Search

Tag: #model-reliability16 results

LLM 遇上指令約束天花板

LLM 遇上指令約束天花板

全新的 CSE 基準測試顯示,LLM 能合理處理個別指令,但在必須同時滿足多項約束時便會陷入困境。研究涵蓋 15 個模型與 369,753 次檢查,結果顯示同時處理約 5 至 6 項以上要求時,全部約束皆通過的成功率會迅速崩落。

ArXiv AIResearchAug 14#benchmarking#model-reliability
前沿模型生產嘗試三分之一失敗

前沿模型生產嘗試三分之一失敗

史丹佛HAI第九屆AI指數報告指出,前沿AI模型在生產嘗試中約三分之一失敗,儘管基準測試有顯著進展。「鋸齒前沿」描述其不均勻表現,能在IMO奪金牌卻無法可靠報時。企業AI採用率達88%,代理基準如SWE-bench(近100%)及Cybench(93%)有進步。

Page 1 of 2