
重新思考 LLM Agent 基準測試:超越靜態排行榜
這項研究指出,目前針對 LLM Agent 的總分排行榜無法準確預測實際部署的效能。作者提出了一種基於預測效度與分佈外測試的新評估框架,以更精確地衡量 Agent 的能力。
Tag: #evaluation-metrics7 results

這項研究指出,目前針對 LLM Agent 的總分排行榜無法準確預測實際部署的效能。作者提出了一種基於預測效度與分佈外測試的新評估框架,以更精確地衡量 Agent 的能力。
作者提出了一種用於機器人操作的新型驗證工具,利用以物件為中心的圖表來防止成功指標洩漏。此舉旨在解決政策作者自行定義成功標準所產生的利益衝突問題。

研究人員提出防禦性指數 (DI) 和歧義指數 (AI) 等新指標,用於評估規則治理的 AI 內容審核,避免人類標籤一致性的「一致性陷阱」。他們引入來自 token logprobs 的機率防禦性信號 (PDS),用於推理穩定性評估。在 193k+ Reddit 決策上驗證,顯示傳統指標的重大差距,並實現 78.6% 自動化覆蓋率。

中國中山大學與阿里巴巴集團研究人員提出SWE-CI全新基準,用以評估AI長期程式碼維護能力。它彌補現有測試僅注重短期程式碼任務的不足。此基準模擬真實軟體工程情境,需要持續維持程式碼品質。

這篇 arXiv 論文提出用於基於 LLM 的網頁代理的正式 AI 規劃框架,將架構對應到經典搜尋範式如 BFS、DFS。它提出五個新指標評估軌跡品質,以及 794 個 WebArena 人工標註軌跡資料集。結果顯示 Step-by-Step 代理更貼近人類路徑,而 Full-Plan 代理在準確度上出色。
Hugging Face 推出了 Real World VoiceEQ,這是一個旨在評估語音 AI 系統人類感知品質的新框架。它旨在為語音模型在現實場景中的自然度與品質提供更準確的基準測試。

本回顧分析了 CODS 2025 AssetOpsBench 挑戰賽,揭示了公開排行榜往往無法預測實際執行效能。研究強調,成功的系統更重視穩健的防護機制,而非複雜的代理架構。