
BenchJack:自動化紅隊測試以揭露 AI 基準測試缺陷
BenchJack 是一個自動化紅隊測試系統,旨在識別 AI 代理基準測試中的獎勵駭客行為。透過將其應用於 10 個主要基準測試,研究人員發現了 219 個缺陷,證明許多當前的評估指標在未實際完成任務的情況下即可輕易被操弄。
Tag: #agent-evaluation34 results

BenchJack 是一個自動化紅隊測試系統,旨在識別 AI 代理基準測試中的獎勵駭客行為。透過將其應用於 10 個主要基準測試,研究人員發現了 219 個缺陷,證明許多當前的評估指標在未實際完成任務的情況下即可輕易被操弄。

DiG-bench 是一項全新的基準測試,用於評估 AI 代理能否透過實驗發現未知規則並提出新穎概括。基準包含 70 款分為七個難度級別的獨立遊戲,其中 21 款公開發布,其餘遊戲保留作安全評估。
Google、Microsoft 與 Grafana 正將模擬、評測、軌跡回放、生產抽樣與可觀測性加入 Agent 平台。這項轉變反映出業界日益迫切的需求:不只確認 Agent 是否成功執行,還要驗證它是否正確且安全地完成真實業務任務。

在 108 家企業中,對自動化評估的完全信任度幾乎從 5% 增至 13%,但通過內部評估後仍導致面向客戶失敗的比例維持在 49%。曾經歷這類失敗的企業最不信任評估,卻反而更可能移除人工介入。

SearchAuditor 推出 SearchAuditBench,用於定位、歸因並修復長期搜尋代理的失敗。該基準包含 1,243 條由專家標註的失敗軌跡,SearchAuditor 達到 32.3% 的端到端通過率,優於現有基準方法。

FinProBench 推出 Role-Grounded Rubric Construction(RGRC),從同一職務專業人士製作的交付成果中建立評測標準。在涵蓋 57 種職業的測試中,RGRC 在專業化職務上的提升最為顯著,表現達 99.1%,高於僅依提示建立評分規準的 78.0%。

FinPerMA 是一套以理論為基礎的基準測試,用於評估 LLM agents 是否能在重大事件後更新個人化使用者模型。在 2,994 個問題與 276 個 personas 的測試中,七個前沿模型及多種記憶配置的準確率都偏低,簡單檢索有時甚至優於專用記憶系統。
本文指出 AI Agent 的評測已不再是簡單的輸出檢查,而需轉向一套完整的質量系統。由於 Agent 的錯誤往往是連鎖反應,開發者應從靜態基準測試轉向貼合業務場景的內部評測。

AgentLens 是一個全新的開源基準測試,旨在根據編碼代理的完整互動軌跡進行評估,而非僅僅依賴二元通過/失敗的結果。它結合了形式驗證與 LLM 生成的評論,為代理的行為與效能提供具體的分析見解。

阿里在國際AI頂會中斬獲最佳資源論文獎,並提出了一套全新的Agent評測範式,旨在解決當前AI代理評測標準的缺失。