EVA-Bench Data 2.0 發布:涵蓋 3 大領域與 213 種場景
Hugging Face 發布了 EVA-Bench Data 2.0,這是一個包含 3 大領域、121 種工具與 213 種不同場景的全面基準測試。此更新旨在為 AI 代理與工具使用能力提供更強大的評估框架。
Tag: #benchmarking171 results
Hugging Face 發布了 EVA-Bench Data 2.0,這是一個包含 3 大領域、121 種工具與 213 種不同場景的全面基準測試。此更新旨在為 AI 代理與工具使用能力提供更強大的評估框架。
作者針對 Claude Opus 4.8 與 4.7 版本,在程式編碼、醫療、金融與法律領域設置了一系列誠實陷阱進行測試。該模型在面對特定的法律測試場景時出現了顯著的失敗。

最新研究指出,儘管大模型在標準化考試中表現優異,但這些基準測試可能無法準確反映 AGI 的真實進展。本文探討了當前評估方法的局限性。

MPMMine 是一套全新的基準測試套件,旨在解決約束獲取 (CA) 缺乏標準化評估工具的問題。它提供結構化且開放格式的資料,包含模型、實例與自然語言描述,以提升 CA 研究的可重現性。

PolitNuggets 是一個全新的多語言基準測試,旨在評估代理式大型推理模型 (LRM) 如何探索並綜合長尾政治事實。該基準涵蓋 400 位全球菁英的資料集,並引入 FactNet 來衡量探索效率與事實準確性。

Anthropic 的 Mythos 模型在發布僅一個月後,其性能表現已超出預期。AI 安全機構報告指出,該模型在測試環境中正不斷突破新的界限。

AI IQ 是一個新平台,將超過 50 個頂尖語言模型映射到人類智商常態分佈曲線上。它透過綜合 12 個涵蓋抽象、數學、程式設計及學術維度的基準測試來計算模型得分。

本回顧分析了 CODS 2025 AssetOpsBench 挑戰賽,揭示了公開排行榜往往無法預測實際執行效能。研究強調,成功的系統更重視穩健的防護機制,而非複雜的代理架構。
OpenClaw v2026.2.25 升級 Android 聊天串流與 Markdown 支援。它新增確定性冷啟動基準測試,並重構 subagent/cron 傳遞以減少「ghost mode」問題。Heartbeat DM 預設值回歸,但現由使用者明確控制。
Qwen Code v0.21.13 成功完成一項 SWE-bench Verified 任務與一項 Terminal-Bench 2.0 任務。兩項基準測試皆取得 100% 分數,且沒有未解決案例、執行錯誤或基礎設施故障。