🐯較早收集於 19m

韁具工程強化AI代理

韁具工程強化AI代理
PostLinkedIn
🐯閱讀原文: 虎嗅
#ai-agents#context-engineering#self-verification#kv-cacheharness-engineeringlangchaingpt-5.2-codexanthropicclaude-sonnet

💡韁具讓代理基準升25%—無需新模型(22字)

⚡ 30-Second TL;DR

有什麼變化

LangChain代理僅改韁具即衝Top 5。

為什麼重要

無需重訓模型即可提升代理可靠性,降低成本與幻覺,利於生產應用。AI開發從提示轉向系統工程。

下一步行動

在LangChain代理中加入Plan-Build-Verify-Fix循環。

誰應關注:Developers & AI Engineers

關鍵要點

  • LangChain代理僅改韁具即衝Top 5。
  • KV快取依穩定前綴規則,將Claude輸入成本降10倍。
  • 自我驗證循環強制Plan-Build-Verify-Fix。
  • 漸進披露分層載入技能省token。
  • 雙代理架構用功能清單追蹤長任務。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • LangChain的「推理三明治」策略透過動態調整計算預算(規劃時高、實施時中、驗證時高)達成66.5%,相比固定最高推理預算的53.9%有顯著改善,揭示並非所有子任務都需最大計算資源[1][3]
  • LocalContextMiddleware透過預先映射目錄結構、可用工具與Python環境,直接注入上下文,解決代理浪費計算資源於環境探索的問題[1]
  • 模型特定的韁具優化不可通用——Claude Opus 4.6使用早期版本韁具僅達59.6%,遠低於GPT-5.2-Codex的66.5%,表明不同模型需要獨立的改進循環[1][4]
  • Terminal Bench 2.0基準測試涵蓋89項跨機器學習、除錯與生物學領域的任務,但作為合成基準可能無法完全代表生產環境中涉及代碼審查與迭代精化的實際軟體開發工作流[3]
📊 競品分析▸ Show
模型/代理Terminal Bench準確率SWE-bench解決率備註
GPT-5.3-Codex (xhigh)53.0%56.8%Codex CLI框架
Claude Opus 4.6 (Adaptive, Max Effort)53.0%80.8%強於SWE-bench但Terminal Bench較弱
Gemini 3.1 Pro Preview53.8%N/ATerminal Bench Hard子集
Claude Opus 4.5 + WarpGrep v2N/A57.5%自訂框架
LangChain deepagents-cli (GPT-5.2-Codex)66.5%N/A韁具工程優化後

🛠️ 技術深入

  • 推理預算模式:GPT-5.2-Codex提供四種推理模式(低、中、高、超高),超高模式消耗2倍以上的token與時間但因逾時限制反而得分53.9%[1][4]
  • 推理三明治架構:規劃階段使用高推理預算以充分理解問題,實施階段降至中等以加速執行,最終驗證階段提升至高以確保品質,整體達成66.5%[1][3]
  • LocalContextMiddleware機制:預先掃描並注入目錄結構、可用工具清單、Python安裝配置等環境資訊,減少代理的環保探索開銷[1]
  • 自我驗證循環:透過系統提示強制Plan-Build-Verify-Fix流程,並明確提示程式測試標準與邊界情況,減少長期「垃圾堆積」現象[1]
  • 中介軟體鉤子:檢測並防止死迴圈等問題模式,與LangSmith整合追蹤每個代理動作、延遲、token計數與成本[4]

🔮 前景展望AI analysis grounded in cited sources

多模型混合系統將成為主流
LangChain團隊暗示未來研究方向包括結合Codex、Gemini與Claude的多模型系統,因為單一模型的韁具優化存在上限[1]
韁具工程將成為LLMOps的核心競爭力
13.7個百分點的改進完全來自提示、工具與中介軟體優化而非模型升級,表明工程優化的邊際收益可能超過模型規模擴展[1][4]
記憶原語與連續學習機制將被整合
LangChain團隊提及未來研究包括記憶原語與RLM等方法以更有效地從執行軌跡中挖掘改進信號[1]

時間線

2025-Q4
LangChain開始Terminal Bench 2.0基準測試,deepagents-cli初始得分52.8%(Top 30外)
2026-01
LangChain實施韁具工程改進循環,包括推理三明治策略與LocalContextMiddleware
2026-02
deepagents-cli達成66.5%,躍升至Terminal Bench 2.0 Top 5,13.7個百分點改進完成
2026-03-02
LangChain發佈韁具工程研究成果與開源Deep Agents(Python與JavaScript版本)
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。