📄ArXiv AI•最新收集於 5h
Harbor 標準化大規模代理評估

#agent-evaluation#benchmarks#open-source#harnessesharbor-adapters-and-harbor-indexharbor-adaptersharbor-indexterminus-2gpt-5.5codex
💡用 82 項精選任務比較代理效能,無須負擔完整基準套件的成本。
⚡ 30-Second TL;DR
有什麼變化
透過經過審查的 adapters 與一致性實驗,支援超過 80 個代理基準。
為什麼重要
此專案透過降低基準與 harness 之間的整合差異,可能提升代理評估的可比性。其精選任務集也讓團隊能在不負擔完整基準套件成本的情況下,執行具挑戰性的評估。
下一步行動
使用 Terminus-2 與你的原生 harness 在 Harbor-Index 上執行代理,衡量對 harness 敏感的效能差異與失效模式。
誰應關注:Researchers & Academics
關鍵要點
- •透過經過審查的 adapters 與一致性實驗,支援超過 80 個代理基準。
- •使用 Terminus-2 與 3 種原生 harness,跨 54 個基準評估 8 個模型。
- •Harbor-Index 收錄來自 29 個基準的 82 項困難且多元的任務。
- •所有模型與 harness 配置的通過率都未超過 30%;GPT-5.5 搭配 Codex 的得分為 28.0%。
- •以開源形式釋出 adapters、評估結果、分析內容與 Harbor-Index。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。

