📄ArXiv AI•較早收集於 19h
JobBench:以人為本的 AI 代理評測基準

💡了解為何 Claude Opus 等頂尖模型在處理真實專業委派任務時,準確率仍難以突破 50%。
⚡ 30-Second TL;DR
有什麼變化
針對 35 個職業的 130 項真實專業任務評估 AI 代理。
為什麼重要
此基準測試挑戰了業界將通用能力置於實際複雜專業協助之上的現狀。它為開發者提供了一條更清晰的路徑,以構建能有效融入現有專家工作流程的 AI 代理。
下一步行動
請查閱 arXiv 上的 JobBench 數據集,找出您的代理模型在哪些專業工作流程中表現不佳。
誰應關注:Researchers & Academics
關鍵要點
- •針對 35 個職業的 130 項真實專業任務評估 AI 代理。
- •將焦點從經濟替代轉向以人為本的增強與任務委派。
- •目前最強模型 Claude Opus 4.7 的準確率僅為 45.9%。
- •採用基於事實的評分準則鏈進行精確的性能評級。
🧠 深度解析
Web-grounded analysis with 11 cited sources.
🔑 增強重點摘要
- •JobBench 由華盛頓大學的 ACTION 研究人員於 2026 年 4 月 22 日發布,是一個開源項目,旨在透過評估 AI 代理在人類專家希望委派的任務上的表現,來衡量其在現實世界中的實用性,而非僅僅關注經濟替代價值。
- •該基準測試採用嚴格的「事實錨定評分標準鏈」,平均每個任務包含 35.6 個二元標準,總計 4,631 個標準,要求代理不僅要得出正確答案,還要展示正確的推理過程,錯誤的推理即使答案正確也無法得分。
- •JobBench 的任務設計基於 Workbank 調查,該調查收集了超過 1,500 名專業人士對其職業中希望 AI 代理接管的任務的評級,確保評估的任務與提升人類工作滿意度和生產力直接相關。
- •該基準測試的任務資料集包含異構的真實世界文件,例如 SQLite 資料庫、多年期 CSV 文件、監管 PDF 和相互矛盾的披露文件,旨在模擬專業工作中雜亂的資訊流,考驗代理處理複雜、非結構化數據的能力。
- •JobBench 的排行榜根據模型在每個動作的成功率以及對「厭倦/漂移」的韌性進行排名,初步結果顯示,即使是最先進的邊緣模型也難以在大量、重複的任務中保持持續的精確度,經常出現幻覺或跳過步驟。
📊 競品分析▸ Show
| 基準測試名稱 | 焦點領域 | 評估方法 | 關鍵差異 | 領先模型表現 (若有) |
|---|---|---|---|---|
| JobBench | 以人為本的專業任務委派 (35個職業,130項任務) | 事實錨定評分標準鏈,要求推理過程;異構真實世界數據;衡量人類希望委派的任務。 | 專注於人類意願和增強,而非經濟替代;強調多步驟、重複性任務的持續精確度。 | Claude Opus 4.7: 45.9% |
| AgentBench | 多輪開放式環境中的推理和決策 (8個環境) | 評估代理在操作系統、數據庫、知識圖譜、遊戲、謎題、家庭、網路購物和網路瀏覽等環境中的能力。 | 涵蓋廣泛的通用代理能力,特別是多輪互動。 | (未提供具體分數) |
| WebArena | 自主代理執行網路任務 | 模擬電子商務、社交論壇、協作程式碼開發和內容管理等四個領域的場景。 | 專注於網路環境中的功能正確性,不論達成目標的方式。 | (未提供具體分數) |
| GAIA | 通用 AI 助理的推理能力 | 跨三個難度級別的通用推理,強調多工具協調。 | 評估代理處理複雜性升級的能力,特別是多工具協調。 | (未提供具體分數) |
| SWE-bench | 軟體工程任務 (程式碼修復、功能請求) | 給予真實的 GitHub 問題,根據程式碼更改是否通過相關測試套件來評分。 | 專注於實際的軟體工程問題解決,要求高精確度。 | Claude Opus 4.7: SWE-bench Verified 87.6%, SWE-bench Pro 64.3% |
| Workspace-Bench | 具有大規模文件依賴的工作區任務 | 構建包含 5 個工作者檔案、74 種文件類型、20,476 個文件 (高達 20GB) 的真實工作區,並策劃 388 個任務。 | 專注於代理在複雜文件依賴環境中的工作區學習能力,涉及跨文件檢索、上下文推理和自適應決策。 | 最佳代理僅達到 68.7%,人類表現為 80.7% |
🛠️ 技術深入
- 設計原則: JobBench 遵循「以人類意願為基礎」的原則,任務選取自 Workbank 調查中超過 1,500 名專業人士希望委派給 AI 的工作職責。它強調「專業推理而非知識傳遞」,要求代理能夠三角測量矛盾的來源並展示推理鏈。
- 評分機制: 採用「事實錨定評分標準鏈」,平均每個任務包含 35.6 個二元標準,總計 4,631 個標準。每個標準都錨定到一個確定性數字、特定的推理步驟或有文檔記錄的專業判斷。只有當鏈中的所有標準都通過時,評分才會被計入,不允許因錯誤推理而得出正確答案的「部分得分」。
- 任務結構: 每個 JobBench 任務都以「小檔案」的形式呈現,包含異構的參考文件,例如 SQLite 數據庫、多年度 CSV 文件、監管 PDF 和相互矛盾的披露文件。這要求代理在混亂的資訊流中進行推理。
- 數據集: 數據集分為
main和easy兩個部分。main包含 65 個完整任務,其中一些包含files_required_to_search/文件夾,用於代理通過搜索發現地面實況材料。easy包含 63 個簡化任務,具有較短的提示且不包含搜索文件,適用於輕量級測試。 - 職業覆蓋: 涵蓋 35 個職業的 130 項任務,這些職業是根據其平均自動化意願得分高於 3,並按經濟敞口排名選出的。
- 評估指標: 排行榜根據模型在每個動作的成功率以及對「厭倦/漂移」的韌性進行排名,這反映了代理在重複性、高容量任務中保持持續精確度的能力。
🔮 前景展望AI analysis grounded in cited sources
AI 代理的發展將更側重於人類增強而非取代。
JobBench 以人類意願為核心的評估方法,將促使 AI 代理的設計和優化朝向協助人類完成其不願或耗時的任務,從而提升整體生產力與工作滿意度。
AI 代理的可靠性和精確度將成為關鍵的研發重點。
目前最強模型在 JobBench 上僅有 45.9% 的準確率,且在重複任務中易出現幻覺或跳過步驟,這表明未來研究需大幅提升代理在複雜、持續性專業任務中的穩定性和錯誤恢復能力。
AI 代理評估將從單一結果導向轉向過程和推理透明化。
JobBench 的事實錨定評分標準鏈要求代理展示正確的推理過程,這將推動開發更具可解釋性和可審計性的 AI 代理模型。
⏳ 時間線
2026-04-22
華盛頓大學 ACTION 研究人員發布 JobBench 基準測試
2026-05-25
JobBench 相關論文在 ArXiv 上發布
📎 來源 (11)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗