
超越準確度:評估 AI Agent 的新框架
這項研究提出了一種針對 AI Agent 的多維度評估框架,認為準確度飽和並不代表基準測試失去價值。研究引入了 CORE-Bench v1.1 及 OOD 套件,用於衡量效率、可靠性及人機協作表現。
Tag: #benchmarking171 results

這項研究提出了一種針對 AI Agent 的多維度評估框架,認為準確度飽和並不代表基準測試失去價值。研究引入了 CORE-Bench v1.1 及 OOD 套件,用於衡量效率、可靠性及人機協作表現。
Papers with Code 推出 OCR 集中化平台,收錄 Chandra OCR 2 與 Mistral OCR v4 等頂尖模型。該平台提供關鍵基準測試與程式碼連結,協助開發者在快速發展的文件數位化工具領域中進行選擇。

DeepSWE 是一個全新的開源基準測試,旨在評估前沿 AI 模型在真實軟體工程任務中的表現。它強調無污染的任務設計、高度的儲存庫多樣性以及基於軟體行為的驗證機制。

這項研究指出,目前針對 LLM Agent 的總分排行榜無法準確預測實際部署的效能。作者提出了一種基於預測效度與分佈外測試的新評估框架,以更精確地衡量 Agent 的能力。

本文介紹了一位華人研究員在開發測試 AI 智慧的評估框架中所扮演的角色。強調了在當前 AI 發展環境中,嚴謹基準測試的重要性。

WorldLines 是一個旨在評估具身智能體在長期記憶與居家任務規劃能力的新基準。它引入了 ObsMem 框架,以解決複雜且長期的互動中,部分可觀測性與狀態追蹤的挑戰。

CEO-Bench 是一項新的基準測試,旨在評估 AI 智能體在模擬 500 天的創業過程中管理公司的能力。它測試了智能體在複雜商業環境中的長期規劃、雜訊數據分析及適應性決策能力。
作者提出了一種用於機器人操作的新型驗證工具,利用以物件為中心的圖表來防止成功指標洩漏。此舉旨在解決政策作者自行定義成功標準所產生的利益衝突問題。

OSGuard 是一個雙粒度基準測試,旨在透過評估本地防護決策與端到端執行,來檢測電腦操作代理的安全性。它能協助識別代理程式在桌面或網頁環境中,透過不安全捷徑達成任務目標的潛在風險。

針對 WorkBench 基準測試的兩年縱向研究顯示,AI 代理在效能與安全性方面有顯著提升。與 2024 年的模型相比,Claude Opus 4.8 現已達到 89% 的任務成功率,且非預期的有害行為大幅減少。