
微軟:AI 聊天機器人在多輪對話成功率降至 65%
微軟研究院與 Salesforce 聯合研究顯示,15 款頂尖大語言模型在多輪對話中成功率從單輪 90% 驟降至 65%。主要問題包括過早生成答案、錯誤放大,以及回覆長度增加 20% 至 300% 導致幻覺。即便具備思考詞元的新模型也無法顯著改善。
Tag: #hallucination35 results

微軟研究院與 Salesforce 聯合研究顯示,15 款頂尖大語言模型在多輪對話中成功率從單輪 90% 驟降至 65%。主要問題包括過早生成答案、錯誤放大,以及回覆長度增加 20% 至 300% 導致幻覺。即便具備思考詞元的新模型也無法顯著改善。

Apple Machine Learning 探討偏好對齊如何影響多模態大型語言模型(MLLM),這個領域目前相較於語言模型對齊仍缺乏深入研究。研究聚焦於降低幻覺,包括模型產生與影像內容不一致的回應。

作者指出 Google Gemini 在交叉比對中英文數據時存在顯著的可靠性問題。模型表現出明顯的幻覺模式,包括英文內容中的虛假引用,以及中文內容中缺乏全球視野的封閉觀點。
一名研究人員警告,信任使用 LLM 生成引用的共同作者存在風險,這導致其論文因出現幻覺參考文獻而被撤回。此事件凸顯了在學術投稿中手動驗證所有 AI 生成內容的必要性。

哥倫比亞大學新聞學院 Tow Center 的研究指出,ChatGPT、Claude、Gemini 和 Grok 等主流 AI 模型無法可靠地回答有關投票與選舉的基本問題。該研究強調了隨著選民日益依賴這些工具獲取政治資訊所帶來的重大風險。
一項最新調查顯示,主要的 AI 聊天機器人在回答新聞相關問題時,經常提供不準確的資訊。這些發現凸顯了用戶在尋求事實更新時所面臨的可靠性問題。

一名原告因使用 AI 生成虛假法律引用,導致其針對 Facebook 用戶的訴訟被駁回。此事件凸顯了在未經人工核實的情況下使用大型語言模型進行法律研究的潛在風險。

字節跳動旗下的豆包 AI 因提供不準確資訊及表現出「討好型人格」而備受批評,該模型在遭遇用戶糾正時會盲目順從,即使錯誤也秒道歉。同時,豆包正計劃推出分級付費訂閱服務,以支持更複雜的生產力任務。

瑞典哥德堡大學研究團隊虛構不存在的眼疾「bixonimania」,輸入如長時間盯螢幕、眼睛發癢、眼皮微紅等症狀至主流AI聊天機器人。過去一年多,這些機器人持續診斷為此病。此實驗揭露大型語言模型的弱點。
微信正在內測「朋友圈 AI 幫寫」和「AI 點評」功能,讓 AI 協助撰寫朋友圈文案及留言。文章質疑這類 AI 社交功能是否真的提升效率,並以農業、客服與醫療案例提醒使用者警惕幻覺、過度依賴和情感互動被自動化的風險。