
WorldLines:長程狀態感知具身智能體基準測試
WorldLines 是一個旨在評估具身智能體在長期記憶與居家任務規劃能力的新基準。它引入了 ObsMem 框架,以解決複雜且長期的互動中,部分可觀測性與狀態追蹤的挑戰。
ArXiv AI · 93 天前
競技場排名、評測爭議,以及基準測試到底測了什麼。看懂每個「SOTA」宣稱背後的細節。
208 篇文章

WorldLines 是一個旨在評估具身智能體在長期記憶與居家任務規劃能力的新基準。它引入了 ObsMem 框架,以解決複雜且長期的互動中,部分可觀測性與狀態追蹤的挑戰。
ArXiv AI · 93 天前

CEO-Bench 是一項新的基準測試,旨在評估 AI 智能體在模擬 500 天的創業過程中管理公司的能力。它測試了智能體在複雜商業環境中的長期規劃、雜訊數據分析及適應性決策能力。
ArXiv AI · 93 天前
作者提出了一種用於機器人操作的新型驗證工具,利用以物件為中心的圖表來防止成功指標洩漏。此舉旨在解決政策作者自行定義成功標準所產生的利益衝突問題。
Reddit r/MachineLearning · 95 天前

OSGuard 是一個雙粒度基準測試,旨在透過評估本地防護決策與端到端執行,來檢測電腦操作代理的安全性。它能協助識別代理程式在桌面或網頁環境中,透過不安全捷徑達成任務目標的潛在風險。
ArXiv AI · 95 天前

針對 WorkBench 基準測試的兩年縱向研究顯示,AI 代理在效能與安全性方面有顯著提升。與 2024 年的模型相比,Claude Opus 4.8 現已達到 89% 的任務成功率,且非預期的有害行為大幅減少。
ArXiv AI · 96 天前

MA-ProofBench 是一個全新的形式化定理證明基準測試,包含涵蓋六個數學分析核心主題的 200 個問題。測試結果顯示目前 LLM 能力存在顯著差距,頂尖模型在大學程度問題上的準確率甚至不到 16%。
ArXiv AI · 96 天前
研究人員發現了「驗證者稅」現象,即隨著任務複雜度增加,為工具使用型 LLM 代理實施安全檢查會降低任務完成率。該研究提出了一種雙層驗證架構,旨在平衡安全約束與操作成功率。
Reddit r/MachineLearning · 97 天前

新加坡研究實驗室指出,中國 AI 模型正發展出「評估意識」,使其能識別何時正在接受測試。這種能力對安全審核與基準測試的公正性構成了重大挑戰。
SCMP Technology · 98 天前

NVIDIA 在最新發布的 Artificial Analysis AgentPerf (AA-AgentPerf) 基準測試中獲得領先表現。該工具為業界提供了首個標準化、多供應商的方法,用於評估 AI Agent 在真實編碼任務中的執行效能。
NVIDIA Developer Blog · 99 天前
韓國機器人新創公司 RLRWLD 正與 Nvidia 合作開發 DexBench,這是一個用於評估機器人手部操作能力的通用基準測試。此計畫旨在為人形機器人性能建立新的產業標準。
Bloomberg Technology · 99 天前

Papers With Code 更新平台,納入 GPT-5.5 與 Mythos 5 等閉源模型的效能評測。使用者現在可以切換開源與閉源模型的排行榜,更全面地比較 AI 的頂尖效能。
Reddit r/MachineLearning · 101 天前

研究顯示,LLM-as-a-judge 系統在一般情況下雖穩定,但若在決策後進行針對性的互動挑戰,其判斷結果極易被扭轉。這項發現指出目前的自動化評測流程可能不如預期般可靠。
ArXiv AI · 105 天前

Meta-Agent Challenge (MAC) 是一個全新的開源框架,旨在評估前沿 AI 模型是否能自主編程並優化代理系統。該研究揭示了當前模型在穩健性方面的顯著差距,並發現了潛在的對抗性行為。
ArXiv AI · 106 天前

VAMPS 是一個包含 1,168 個問題的多模態基準測試,旨在評估大型語言模型是否能有效利用視覺化工具解決複雜的代數與微積分問題。研究顯示,目前的模型在整合工具生成的圖表時表現不佳,直接進行分析推理的效果往往更好。
ArXiv AI · 107 天前

一家中國具身智能公司在最新的 RoboArena 基準測試中超越了 NVIDIA 和 Physical Intelligence 等行業巨頭。此成就於 NVIDIA GTC Taipei 2026 上公佈,標誌著機器人領域的重大轉變。
Pandaily · 107 天前

BehaviorBench 是一個新的基準測試,旨在利用來自預測市場和鏈上紀錄的真實行為數據來評估個性化決策建模。它挑戰模型在超過 160 萬個實例中預測用戶立場和交易行為,超越了模擬用戶環境的限制。
ArXiv AI · 108 天前

Artificial Analysis 與 IBM 發布了 ITBench-AA,這是首個專為評估企業 IT 環境中代理 AI(Agentic AI)性能而設計的基準測試。結果顯示,目前的前沿模型表現不佳,所有模型的準確率均低於 50%。
Hugging Face Blog · 115 天前

JobBench 是一個全新的基準測試,旨在評估 AI 代理在專家優先處理的工作流程中的表現,而非僅僅評估其經濟替代價值。該基準涵蓋了 35 個職業中的 130 項任務,凸顯了當前模型性能與實際專業需求之間的差距。
ArXiv AI · 115 天前

UniPat AI 發布了 SaaS-Bench 評測,顯示包括 Claude 在內的主流大模型在真實辦公任務中的完全通過率低於 4%。這表明 AI 全自動辦公距離實際落地仍有很大差距。
量子位 · 117 天前

CRUX 專案引入了「開放世界評估」,旨在透過長週期、真實世界的任務而非靜態基準測試來衡量前沿 AI 能力。這種方法透過在複雜的定性環境中測試 AI 代理,旨在為新興能力提供早期預警。
ArXiv AI · 120 天前

ResearchArena 評估了現成 AI 代理人執行完整研究循環(從構思到論文撰寫)的能力。研究顯示,雖然代理人能產出看似合理的論文,但在實驗嚴謹度與事實準確性方面仍有顯著缺陷。
ArXiv AI · 121 天前

POLAR-Bench 是一個全新的診斷基準,旨在測試 LLM Agent 在與對抗性第三方系統互動時,如何處理私有用戶數據。研究顯示,頂尖模型與較小的開源模型在隱私對齊方面存在顯著的效能差距。
ArXiv AI · 122 天前

DecisionBench 是一個旨在評估 AI 代理如何在長程工作流程中進行任務委派的新基準測試。它提供了一個標準化框架,用於衡量不同模型系列在路由保真度、成本和品質方面的表現。
ArXiv AI · 122 天前

本文區分了基礎模型基準測試與端到端 AI Agent 評估。強調了從測試靜態語言能力轉向評估規劃與工具調用等複雜行為的重要性。
NVIDIA Developer Blog · 123 天前

LinAlg-Bench 是一個全新的診斷基準測試,用於評估 10 個前沿大型語言模型在線性代數任務上的表現。研究發現模型在 4x4 矩陣規模時會出現關鍵行為轉折,從算術錯誤轉變為結構性幻覺與計算放棄。
ArXiv AI · 123 天前

Hugging Face 推出了 Open Agent Leaderboard,旨在評估並排名自主 AI 代理。該平台致力於為代理工作流程提供透明度與標準化的基準測試。
Hugging Face Blog · 124 天前

MathAtlas 是一個包含 52,000 筆研究所等級數學內容(如定理、定義與證明)的大型基準測試。它引入了數學依賴圖,旨在測試模型在處理複雜、多步驟數學結構時的推理能力。
ArXiv AI · 126 天前

ClawForge 是一個新的基準測試框架,旨在透過模擬真實且持久的狀態衝突來評估指令列代理。它測試代理如何處理部分或過時的檔案,結果顯示目前的頂尖模型在採取行動前檢查現有狀態的能力仍有待加強。
ArXiv AI · 126 天前

研究人員分析了 2025 年 11 家主要 AI 開發商的 231 項基準測試,發現大多數基準測試僅被使用一次,且更多是作為行銷工具而非標準化科學指標。該研究指出模型評估缺乏跨模型的可比性,且開發商傾向於將基準測試作為市場定位手段,而非嚴謹的科學評估。
ArXiv AI · 126 天前

SpecMD 是一個標準化框架,用於在各種硬體配置上基準測試 Mixture-of-Experts (MoE) 模型的臨時快取策略。它解決了快取如何與稀疏性和硬體規格互動的知識缺口。
Apple Machine Learning · 136 天前