
GPT-5.5 在全新 ALE 基準測試中擊敗 Claude Fable 5
加州大學柏克萊分校研究人員推出了「Agents’ Last Exam」(ALE),這是一項嚴格的基準測試,旨在評估 AI 代理在真實、長週期專業工作流程中的表現。GPT-5.5 獲得最高分,擊敗了 Anthropic 的 Claude Fable 5,該測試強調實際勞動力影響而非靜態編碼難題。
Tag: #benchmarking171 results

加州大學柏克萊分校研究人員推出了「Agents’ Last Exam」(ALE),這是一項嚴格的基準測試,旨在評估 AI 代理在真實、長週期專業工作流程中的表現。GPT-5.5 獲得最高分,擊敗了 Anthropic 的 Claude Fable 5,該測試強調實際勞動力影響而非靜態編碼難題。

中國新創公司 Spirit AI 在 RoboArena 排行榜上超越了 Nvidia 的機器人模型。其 Spirit v1.6 模型獲得 1,924 分,擊敗了 Nvidia 的 Cosmos3-Nano-Policy。

Datacurve 推出了 DeepSWE 程式碼評測基準,揭示了頂尖模型間的顯著效能差距,並將 GPT-5.5 評為領先者。該報告同時指出現有的 SWE-Bench Pro 評估存在 32% 的錯誤率,質疑了當前產業標準的可靠性。

AI 先驅李飛飛推出了一項旨在評估具身空間智能的新基準。該計畫旨在為下一代機器人和空間智能系統提供標準化的數據集與評估框架。

BenchJack 是一個自動化紅隊測試系統,旨在識別 AI 代理基準測試中的獎勵駭客行為。透過將其應用於 10 個主要基準測試,研究人員發現了 219 個缺陷,證明許多當前的評估指標在未實際完成任務的情況下即可輕易被操弄。

研究人員開發了 EsoLang-Bench,使用像 Brainfuck 和 Befunge-98 等冷門語言測試真正的程式碼推理,而非模式匹配。頂尖模型如 GPT-5.2、O4-mini 和 Gemini 最佳得分僅 11.2%,中高難度問題全為 0%。此基準強調需要不可操縱的評估,並提供網站和論文。
Qwen Code v0.21.14 成功完成一項 SWE-bench Verified 任務及一項 Terminal-Bench 2.0 任務。兩項基準測試均取得 100% 分數,且沒有未解決案例、執行錯誤或基礎設施故障。
Qwen Code v0.21.13 完成了隔離式 DSW EAS 網路與 watchdog 冒煙測試,成功解決唯一的 SWE-bench Verified 案例,取得 100% 分數。Terminal-Bench 2.0 執行雖已完成,但發生基礎設施錯誤,因此結果無法計分。

文章指出,MiniMax H3 正快速縮小與 Seedance 之間的差距。隨著模型能力迅速普及,Seedance 過去的領先優勢可能已所剩不多。
一名研究人員批評某些評估做法,指出這些做法可能讓稀疏注意力與 KV cache 壓縮方法看起來比實際更有效。文章點出簡單的檢索任務、不對等的基準調校、有利提示詞,以及實作上的優勢,都可能扭曲比較結果。