📄最新收集於 5h

Harbor 標準化大規模代理評估

Harbor 標準化大規模代理評估
PostLinkedIn
📄閱讀原文: ArXiv AI
#agent-evaluation#benchmarks#open-source#harnessesharbor-adapters-and-harbor-indexharbor-adaptersharbor-indexterminus-2gpt-5.5codex

💡用 82 項精選任務比較代理效能,無須負擔完整基準套件的成本。

⚡ 30-Second TL;DR

有什麼變化

透過經過審查的 adapters 與一致性實驗,支援超過 80 個代理基準。

為什麼重要

此專案透過降低基準與 harness 之間的整合差異,可能提升代理評估的可比性。其精選任務集也讓團隊能在不負擔完整基準套件成本的情況下,執行具挑戰性的評估。

下一步行動

使用 Terminus-2 與你的原生 harness 在 Harbor-Index 上執行代理,衡量對 harness 敏感的效能差異與失效模式。

誰應關注:Researchers & Academics

關鍵要點

  • 透過經過審查的 adapters 與一致性實驗,支援超過 80 個代理基準。
  • 使用 Terminus-2 與 3 種原生 harness,跨 54 個基準評估 8 個模型。
  • Harbor-Index 收錄來自 29 個基準的 82 項困難且多元的任務。
  • 所有模型與 harness 配置的通過率都未超過 30%;GPT-5.5 搭配 Codex 的得分為 28.0%。
  • 以開源形式釋出 adapters、評估結果、分析內容與 Harbor-Index。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。