🐯虎嗅•較早收集於 19m
韁具工程強化AI代理

#ai-agents#context-engineering#self-verification#kv-cacheharness-engineeringlangchaingpt-5.2-codexanthropicclaude-sonnet
💡韁具讓代理基準升25%—無需新模型(22字)
⚡ 30-Second TL;DR
有什麼變化
LangChain代理僅改韁具即衝Top 5。
為什麼重要
無需重訓模型即可提升代理可靠性,降低成本與幻覺,利於生產應用。AI開發從提示轉向系統工程。
下一步行動
在LangChain代理中加入Plan-Build-Verify-Fix循環。
誰應關注:Developers & AI Engineers
關鍵要點
- •LangChain代理僅改韁具即衝Top 5。
- •KV快取依穩定前綴規則,將Claude輸入成本降10倍。
- •自我驗證循環強制Plan-Build-Verify-Fix。
- •漸進披露分層載入技能省token。
- •雙代理架構用功能清單追蹤長任務。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •LangChain的「推理三明治」策略透過動態調整計算預算(規劃時高、實施時中、驗證時高)達成66.5%,相比固定最高推理預算的53.9%有顯著改善,揭示並非所有子任務都需最大計算資源[1][3]
- •LocalContextMiddleware透過預先映射目錄結構、可用工具與Python環境,直接注入上下文,解決代理浪費計算資源於環境探索的問題[1]
- •模型特定的韁具優化不可通用——Claude Opus 4.6使用早期版本韁具僅達59.6%,遠低於GPT-5.2-Codex的66.5%,表明不同模型需要獨立的改進循環[1][4]
- •Terminal Bench 2.0基準測試涵蓋89項跨機器學習、除錯與生物學領域的任務,但作為合成基準可能無法完全代表生產環境中涉及代碼審查與迭代精化的實際軟體開發工作流[3]
📊 競品分析▸ Show
| 模型/代理 | Terminal Bench準確率 | SWE-bench解決率 | 備註 |
|---|---|---|---|
| GPT-5.3-Codex (xhigh) | 53.0% | 56.8% | Codex CLI框架 |
| Claude Opus 4.6 (Adaptive, Max Effort) | 53.0% | 80.8% | 強於SWE-bench但Terminal Bench較弱 |
| Gemini 3.1 Pro Preview | 53.8% | N/A | Terminal Bench Hard子集 |
| Claude Opus 4.5 + WarpGrep v2 | N/A | 57.5% | 自訂框架 |
| LangChain deepagents-cli (GPT-5.2-Codex) | 66.5% | N/A | 韁具工程優化後 |
🛠️ 技術深入
- •推理預算模式:GPT-5.2-Codex提供四種推理模式(低、中、高、超高),超高模式消耗2倍以上的token與時間但因逾時限制反而得分53.9%[1][4]
- •推理三明治架構:規劃階段使用高推理預算以充分理解問題,實施階段降至中等以加速執行,最終驗證階段提升至高以確保品質,整體達成66.5%[1][3]
- •LocalContextMiddleware機制:預先掃描並注入目錄結構、可用工具清單、Python安裝配置等環境資訊,減少代理的環保探索開銷[1]
- •自我驗證循環:透過系統提示強制Plan-Build-Verify-Fix流程,並明確提示程式測試標準與邊界情況,減少長期「垃圾堆積」現象[1]
- •中介軟體鉤子:檢測並防止死迴圈等問題模式,與LangSmith整合追蹤每個代理動作、延遲、token計數與成本[4]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2025-Q4
LangChain開始Terminal Bench 2.0基準測試,deepagents-cli初始得分52.8%(Top 30外)
2026-01
LangChain實施韁具工程改進循環,包括推理三明治策略與LocalContextMiddleware
2026-02
deepagents-cli達成66.5%,躍升至Terminal Bench 2.0 Top 5,13.7個百分點改進完成
2026-03-02
LangChain發佈韁具工程研究成果與開源Deep Agents(Python與JavaScript版本)
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- blockchain.news — Langchain Terminal Bench Harness Engineering Breakthrough
- smartscope.blog — LLM Coding Benchmark Comparison 2026
- zenml.io — Harness Engineering for Agentic Coding Systems
- blog.langchain.com — Improving Deep Agents with Harness Engineering
- llm-stats.com — Gpt 5.2 Codex vs Longcat Flash Chat
- towardsai.net — Choosing Your AI Coding Engine in 2026
- slashdot.org — Agentbench vs Gpt 5.2 Codex
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗
每週 AI 簡報
每週一封,可隨時退訂。


