📄ArXiv AI•較早收集於 17h
ClawForge:評估指令列代理在狀態衝突下的表現

💡了解為何頂尖 AI 模型在面對持久狀態衝突時,於指令列任務中表現不佳。
⚡ 30-Second TL;DR
有什麼變化
推出 ClawForge-Bench,涵蓋 6 種能力類別共 17 個場景。
為什麼重要
這項研究凸顯了當前代理工作流程中的關鍵缺口:無法管理持久化環境。這表明未來的代理開發必須優先考慮狀態感知能力,以提高在實際軟體工程任務中的可靠性。
下一步行動
將狀態檢查步驟納入代理的工具使用迴圈中,以便在執行破壞性指令前驗證環境狀態。
誰應關注:Researchers & Academics
關鍵要點
- •推出 ClawForge-Bench,涵蓋 6 種能力類別共 17 個場景。
- •基於持久的工作流程介面而非靜態提示完成度來評估代理。
- •指出代理的效能極度依賴於檢查現有狀態的能力。
- •揭示頂尖模型在複雜指令列任務中的嚴格準確率僅達 45.3%。
🧠 深度解析
Web-grounded analysis with 10 cited sources.
🔑 增強重點摘要
- •ClawForge 是一個生成器支援的基準測試框架,其任務是可執行規範,從情境模板、具體化插槽、初始化狀態、參考軌跡和驗證器生成,確保了可重現性和可擴展性。
- •該框架透過正規化的最終狀態和可觀察的副作用來逐步評估代理,而非僅僅依賴於精確的軌跡匹配,這提供了一種更穩健的評估方法。
- •ClawForge-Bench 涵蓋 17 個情境,分為 6 個能力類別,旨在測試現實世界中的失敗模式,例如避免重複、修復過時狀態、替換錯誤狀態以及多源分支解析。
- •對七個頂尖模型的評估顯示,在「錯誤狀態替換」方面的嚴格準確率低於 17%,而在「中斷工作流程恢復」方面則存在最大的模型差距(17% 至 90%),這主要取決於代理在採取行動前是否檢查現有狀態。
- •部分分數和步驟效率分析進一步揭示,許多失敗是「接近成功」而非早期崩潰,且模型在狀態衝突下表現出性質不同的失敗風格。
📊 競品分析▸ Show
| 基準測試名稱 | 評估重點 | 環境類型 | 頂尖模型表現 |
|---|---|---|---|
| ClawForge | 指令列代理在狀態衝突下的表現(處理部分、過時或衝突的狀態) | 持久的工作流程介面 | 嚴格準確率 45.3% |
| Terminal-Bench | AI 代理在真實終端環境中執行端到端任務(編譯程式碼、系統管理等) | 真實終端環境(Docker 容器中的沙盒) | Claude Sonnet 4.5 達到 50.0% (Terminal-Bench 2.0 中頂尖模型低於 65%) |
| WildClawBench | 語言和視覺語言模型在真實 CLI 環境中執行長週期任務 | 真實 CLI 環境與真實工具(非合成沙盒) | Claude Opus 4.7 達到 62.2% |
| ClawBench | AI 代理執行日常線上任務(購物、預約、填寫表格) | 實際生產網站 | Claude Sonnet 4.6 達到 33.3% |
| ClawWork | AI 代理在模擬經濟中完成專業任務並賺取金錢 | 模擬經濟環境 | Claude Opus 4 將 10 美元變成 19,915 美元 |
| ClawMark | 多輪、多日、多模態協作代理在不斷變化的狀態環境中的表現 | 有狀態的沙盒服務環境(檔案系統、電子郵件、日曆等) | 嚴格任務成功率 20.0% |
🛠️ 技術深入
- ClawForge 是一個生成器支援的基準測試系統,每個任務都是一個可執行的規範,由情境模板、具體化插槽、初始化狀態、參考軌跡、驗證器和元數據共同生成。
- 任務定義為一個元組
(x, S0, C*, E, m),其中x是自然語言指令,S0是初始化環境狀態(可包含部分、過時或衝突的工件),C*是參考命令軌跡,E是可執行檢查(驗證器),m是結構化元數據。 - 該框架在有狀態的 CLI 風格環境中執行任務,該環境公開工作流程介面(例如,任務、日曆、電子郵件、檔案)。
- 評估採用「結果優先評分」協議,根據正規化的最終狀態和可觀察的副作用進行功能性評估,而非嚴格的命令軌跡匹配。
- ClawForge-Bench 實例化包含 17 個情境,涵蓋六個主要能力類別:避免重複、填補空白、資訊傳輸、多源推理、狀態修復和工作流程完成。
- 相關程式碼和數據可在 GitHub 上獲取。
🔮 前景展望AI analysis grounded in cited sources
未來的 AI 代理將需要更複雜的狀態管理和衝突解決能力。
ClawForge 揭示了當前模型在處理預先存在且衝突的狀態時的顯著弱點,這表明這是未來代理開發實現穩健現實世界性能的關鍵領域。
基準測試框架將越來越多地側重於動態、有狀態和類似真實世界的環境。
ClawForge 所揭示的局限性,以及 Terminal-Bench、WildClawBench 等其他基準測試的存在,都表明了從靜態、乾淨狀態評估轉向更複雜、互動式情境的趨勢。
能夠執行自主、長週期任務的 AI 代理的發展將受限於其推理和適應不斷變化的環境的能力。
ClawForge 的發現,特別是低嚴格準確率和狀態檢查的影響,表明僅僅擁有知識或程式碼生成能力是不夠的;代理需要理解並響應動態的環境變化。
⏳ 時間線
2026-05-13
ClawForge 論文在 ArXiv 上發表
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗

