AI 基準測試最新動態
競技場排名、評測爭議,以及基準測試到底測了什麼。看懂每個「SOTA」宣稱背後的細節。
135 篇文章
禁用工具後,Opus 5 與 GPT-5.6 的差距浮現
一項禁用外部工具的測試比較 Opus 5 與 GPT-5.6,並認為兩者的能力差距因此更加清晰。文章也指出,更強的原生推理能力可能降低傳統提示詞工程的重要性。
診斷 AI Agent 失敗的新方法
這項研究提出以互動為核心的分類法,將 Agent 失敗定位到模型、Harness、使用者、工具、記憶體與環境之間的互動。其 41 種失敗模式可指出修復工作應歸屬於模型後訓練、Harness 工程、環境重新設計或基準測試修正。
利用多模型同儕審查評估自主 AI 科學家系統
本研究提出了一套嚴謹的基準測試協議,利用多模型 LLM 同儕審查來評估自主 AI 研究系統。研究針對四種框架與商業基準進行評測,揭示了顯著的效能差距,並驗證了自動化評估的可靠性。
LSR-Synth 測試 AI 是發現還是回憶方程式
本研究評估 LSR-Synth 能否區分真正的符號發現、方程式記憶與傳統運算子搜尋。研究發現,固定且不具語意的詞彙已能解決目前大多數任務;只有在刻意移除部分詞彙覆蓋範圍時,語言模型生成的候選項才會帶來顯著價值。
Schema 評測工具在 ARC-AGI-3 基準測試達到 99% 分數
全新的「Schema」評測工具透過優化模型與遊戲環境之間的互動流程,提升了在 ARC-AGI-3 基準測試上的表現。它利用 Claude Opus 4.8 和 Fable 5,在不修改模型權重的情況下達到了 99% 的準確率。
GPT-5.6 在複雜 3D 生成任務中表現超越競爭對手
透過 63 道複雜提示詞測試,GPT-5.6 Sol Ultra 在生成細節豐富且具互動性的 3D 網頁環境方面,顯著優於其他模型。
AI 駭客能力已超越現有安全評測基準
目前的安全性評測基準已無法準確衡量前沿 AI 模型不斷演進的駭客能力。這導致安全團隊與監管機構缺乏可靠的工具來評估先進系統所帶來的風險。
新基準 MemoBench 揭露世界模型記憶缺陷
MemoBench 是一個全新的診斷基準,旨在測試世界模型在動態環境中維持物體恆存與狀態演化的能力。研究顯示,目前的影片生成模型在物體被遮擋期間,難以準確追蹤並更新其狀態。
Zhipu AI 的 GLM-5.2 模型在網路安全任務中表現優異
北京新創公司 Zhipu AI 發布了 GLM-5.2,該模型在網路安全漏洞檢測任務中展現出與 Anthropic 的 Claude Opus 4.8 相當的競爭力。此進展凸顯了中國 AI 模型與美國頂尖模型之間的差距正在縮小。
First Proof測試:人類在嚴謹數學研究中仍優於AI
First Proof計畫針對四個AI系統進行了原創且未公開的研究級數學題測試,結果顯示儘管AI表現亮眼,但在整體研究能力上仍落後於頂尖人類數學家。
Weibo 的 3B 模型在基準測試中挑戰 AI 擴展定律
Sina Weibo 的研究人員推出了 VibeThinker-3B,這是一款 30 億參數的模型,據稱其推理能力可媲美甚至超越大型旗艦模型。此發布在 AI 社群中引發了關於當前基準測試有效性的激烈爭論。
GPT-5.5 在全新 ALE 基準測試中擊敗 Claude Fable 5
加州大學柏克萊分校研究人員推出了「Agents’ Last Exam」(ALE),這是一項嚴格的基準測試,旨在評估 AI 代理在真實、長週期專業工作流程中的表現。GPT-5.5 獲得最高分,擊敗了 Anthropic 的 Claude Fable 5,該測試強調實際勞動力影響而非靜態編碼難題。
Spirit AI 在機器人基準測試中超越 Nvidia
中國新創公司 Spirit AI 在 RoboArena 排行榜上超越了 Nvidia 的機器人模型。其 Spirit v1.6 模型獲得 1,924 分,擊敗了 Nvidia 的 Cosmos3-Nano-Policy。
DeepSWE 評測挑戰 AI 程式碼排行榜與 GPT-5.5 的領先地位
Datacurve 推出了 DeepSWE 程式碼評測基準,揭示了頂尖模型間的顯著效能差距,並將 GPT-5.5 評為領先者。該報告同時指出現有的 SWE-Bench Pro 評估存在 32% 的錯誤率,質疑了當前產業標準的可靠性。
李飛飛發布空間智能領域的 ImageNet
AI 先驅李飛飛推出了一項旨在評估具身空間智能的新基準。該計畫旨在為下一代機器人和空間智能系統提供標準化的數據集與評估框架。
BenchJack:自動化紅隊測試以揭露 AI 基準測試缺陷
BenchJack 是一個自動化紅隊測試系統,旨在識別 AI 代理基準測試中的獎勵駭客行為。透過將其應用於 10 個主要基準測試,研究人員發現了 219 個缺陷,證明許多當前的評估指標在未實際完成任務的情況下即可輕易被操弄。
難以作弊程式碼基準測試揭露 LLM 極限
研究人員開發了 EsoLang-Bench,使用像 Brainfuck 和 Befunge-98 等冷門語言測試真正的程式碼推理,而非模式匹配。頂尖模型如 GPT-5.2、O4-mini 和 Gemini 最佳得分僅 11.2%,中高難度問題全為 0%。此基準強調需要不可操縱的評估,並提供網站和論文。
Kimi K3 在 ArtificialAnalysis 排名第三,超越 Claude Opus
Kimi K3 模型在 ArtificialAnalysis 排行榜上取得第三名的佳績。在這次基準測試評估中,它顯著超越了 Claude Opus 4.8 模型。
Moonshot AI 的 Kimi K3 在影片生成領域挑戰 Fable 5
Moonshot AI 的全新 Kimi K3 模型已出現在基準測試平台,展示了足以媲美 Fable 5 的影片生成能力。社群媒體上的早期測試顯示,該模型在動畫流暢度與視覺細節方面有顯著提升。
Papers with Code 推出專屬機器人基準測試頁面
Papers with Code 推出了專屬的機器人技術專區,用於追蹤主要基準測試、熱門論文和開源項目。目前涵蓋了 LIBERO 和 SimplerEnv 等基準測試中的 110 多個項目。
用於開放式多代理 LLM 協作的新基準測試
研究人員發布了 ALEM 基準測試,旨在評估 LLM 代理在複雜、開放式環境中的協作能力。測試結果顯示,儘管大多數模型表現不佳,但 Gemini 3.1 Pro 在高難度任務中展現了與專業訓練模型相當的潛力。
全新基準測試評估 AI 代理在長程終端任務的表現
Long-Horizon-Terminal-Bench 引入了一套新的 AI 代理評估框架,包含 46 項需要長期規劃與迭代除錯的複雜多步驟任務。該基準測試透過提供密集的中間獎勵,能比傳統僅評估最終結果的方法更精確地衡量代理在開放式工作流程中的進展。
AI Gateway 排行榜現已支援開放數據與圖表分享
Vercel 的 AI Gateway 排行榜現在提供可分享的圖表以及對生產流量數據的開放存取。使用者可以透過可下載的 CSV 或程式化匯出端點來分析模型、實驗室、應用程式與供應商的效能。
醫療推理與臨床需求之大型語言模型研究綜述
本研究綜述透過將臨床能力等級與計算推理模式進行對應,評估了大型語言模型在醫療領域的應用。文中引入了一個涵蓋五個推理層級的基準測試,並比較了 18 種先進模型,以識別臨床實踐中的效能差距。
SageMath 增強型代理提升數學問題解決能力
研究人員提出了一種結合 LLM 推理與 SageMath 可驗證計算的 ReAct 風格代理框架。研究顯示,該架構在多種模型上均顯著提升了效能,有效縮小了開源權重模型與閉源模型之間的差距。
衡量超越人類能力的 AI 智慧
這項研究提出了一種評估超越人類能力 AI 模型的新範式,透過相對衡量而非靜態基準來進行評估。該框架利用模型生成的挑戰,建立了一套能隨代理能力同步擴展的對抗性心理測量評分系統。
AgentLens:用於評估編碼代理軌跡的全新基準測試
AgentLens 是一個全新的開源基準測試,旨在根據編碼代理的完整互動軌跡進行評估,而非僅僅依賴二元通過/失敗的結果。它結合了形式驗證與 LLM 生成的評論,為代理的行為與效能提供具體的分析見解。
RoboDojo:具身智能的全新評測基準
RoboDojo 作為具身智能的全新高難度評測基準正式發布,揭示了人類與當前 AI 模型在物理任務執行上的巨大差距。測試顯示,即使是最先進的模型在處理具身任務時,距離人類水平仍有顯著落差。
OpenAI 指出 SWE-Bench Pro 程式碼評測基準的可靠性問題
OpenAI 發布了一項分析,強調 SWE-Bench Pro 評測基準中的重大缺陷。該報告質疑目前用於評估 AI 程式編寫能力的評測方法之準確性與可靠性。
RAG 對於提升本地 LLM 技術問答準確度至關重要
開發者實驗顯示,本地 LLM 若無 RAG 支援,在回答技術問題時表現不佳,但結合知識庫後效果顯著。該研究測試了包括 Apple Intelligence 和 Qwen 在內的多種模型,證實了上下文注入的有效性。