
Anthropic 推出 Claude Opus 4.8,提升模型誠實度
Anthropic 即將發布 Claude Opus 4.8,這是一個專注於減少幻覺與無根據主張的新模型版本。該模型旨在更好地標記不確定性,並提供比前代更可靠的輸出。
Tag: #model-reliability16 results

Anthropic 即將發布 Claude Opus 4.8,這是一個專注於減少幻覺與無根據主張的新模型版本。該模型旨在更好地標記不確定性,並提供比前代更可靠的輸出。

全新的 CSE 基準測試顯示,LLM 能合理處理個別指令,但在必須同時滿足多項約束時便會陷入困境。研究涵蓋 15 個模型與 369,753 次檢查,結果顯示同時處理約 5 至 6 項以上要求時,全部約束皆通過的成功率會迅速崩落。

本文詳細說明了一次生產環境故障,升級至 Claude Sonnet 4.5 後,模型輸出的 JSON 結構發生意外變更,導致下游 API 整合失效。這凸顯了假設 LLM 版本更新具備穩定性的風險。

研究人員發現大型推理模型 (LRM) 存在「有害的過度思考」現象,即在得出正確答案後繼續推理會導致邏輯偏差。研究顯示,在首次出現正確答案時提早停止推理,可將準確度提升高達 21%。

針對 Claude Opus 4.8、ChatGPT 5.5 與 Kimi 2.6 進行的實測比較。分析指出 Anthropic 更加強調模型可靠性,並顯著降低了程式碼編寫中的錯誤率。

GPT-5.5 Pro推理達人類前0.1%,知識盲區卻86%給錯答案,Claude Opus 4.7僅36%。智商競爭邊際遞減,轉向可控成本可靠運行。

史丹佛HAI第九屆AI指數報告指出,前沿AI模型在生產嘗試中約三分之一失敗,儘管基準測試有顯著進展。「鋸齒前沿」描述其不均勻表現,能在IMO奪金牌卻無法可靠報時。企業AI採用率達88%,代理基準如SWE-bench(近100%)及Cybench(93%)有進步。

作者指出 Google Gemini 在交叉比對中英文數據時存在顯著的可靠性問題。模型表現出明顯的幻覺模式,包括英文內容中的虛假引用,以及中文內容中缺乏全球視野的封閉觀點。

本研究介紹了一套將生成式模型整合至傳統計算系統的基礎框架。透過定義四種架構原語並指出兩項產業反模式,旨在提升 AI 混合系統的可靠性與安全性。
Team Mirai 的安野貴博針對 Anthropic 旗下 Mythos 5 與 Fable 5 模型突然停止服務一事發表評論。他強調,AI 開發的「牧歌式」時代已經結束。