
OpenAI 禁止 Codex 提及哥布林
OpenAI 已修訂其 Codex 程式碼代理的指示,明確禁止提及哥布林、小精靈、浣熊、食人妖、食人魔、鴿子或其他生物,除非絕對相關。此更新旨在防止程式碼情境中無關或幻覺回應。此指令為代理核心系統提示的一部分。
Tag: #hallucinations35 results

OpenAI 已修訂其 Codex 程式碼代理的指示,明確禁止提及哥布林、小精靈、浣熊、食人妖、食人魔、鴿子或其他生物,除非絕對相關。此更新旨在防止程式碼情境中無關或幻覺回應。此指令為代理核心系統提示的一部分。
Sullivan & Cromwell 向紐約聯邦法官致歉,因高調案件文件中出現AI幻覺導致的錯誤。這些錯誤包括Prince Group案文件的準確引用不實。全球重組部門共同負責人Andrew Dietderich於週六發出道歉信。
使用者回報 Qwen3.5/3.6 27B/35B、Gemma4 26B、GPS-OSS 20B 等本地模型工具呼叫不可靠,使用 Open WebUI 及 LM Studio。即使用 Unsloth 參數,仍有幻覺、不存在檔案、空輸出及執行迴圈問題。質疑是否模型限制或設定錯誤。
Merryn Somerset Webb 訪問 Fractal Brain 執行長 Janusz Marecki,討論 AI 炒作對比現實。焦點在大型語言模型 (LLMs) 面臨資料上限、擴大運算收益遞減、幻覺及機率錯誤等基本限制。

一項實驗詢問 ChatGPT WIRED 評測師對電視、耳機和筆電的最佳推薦。它給出完全錯誤的答案,捏造不正確的推薦。這暴露了 LLM 在事實產品回憶上的限制。

AI 讓工作者能處理超出專業範圍的任務,使通才重新成為關鍵。Anthropic 的研究顯示工程師變得更全棧,完成 27% 以往被忽略的任務。但 AI 幻覺仍需小心驗證。

加州新創公司 Memvid 提供日薪 800 美元的「AI 霸凌者」職位,專注測試領先聊天機器人的耐心與記憶力。此工作涉及挑釁 AI 以揭露不一致、遺忘、胡說或幻覺等問題,無需開會或處理郵件。這突顯了 AI 穩健性評估的獨特方法。
一位新手使用 WhatsApp 聊天記錄微調 Llama 3.1 3B-Instruct 模型,希望模仿個人打字風格,但模型會無端提及過去隨機事件,如數學考試。對簡單問候,它回覆無關查詢。使用者尋求修正建議。

Amazon 強推如 Kiro 的 AI 工具生成程式碼,但常產生幻覺與錯誤程式碼。開發者如 Dina 大多時間花在修正或還原 AI 輸出。此舉在監控疑慮下增加工作量。

一項針對11個LLM的研究顯示,它們很少拒絕回答GOV.UK政府服務查詢,即使應該拒絕時也不會,而是提供冗長回應掩蓋準確資訊。當被要求簡潔時,聊天機器人常引入事實錯誤。此研究質疑其用於官方資訊的可信度。