💼較早收集於 18m

Claude Code 推出 /goals 功能,實現自動化代理任務評估

Claude Code 推出 /goals 功能,實現自動化代理任務評估
PostLinkedIn
💼閱讀原文: VentureBeat

💡透過 Anthropic 新的基於目標的評估架構,防止您的 AI 編碼代理過早停止工作。

⚡ 30-Second TL;DR

有什麼變化

引入雙模型架構:一個負責執行,另一個負責評估。

為什麼重要

此功能解決了生產環境 AI 代理的一個主要痛點:過早結束任務。它透過標準化「評論者(critic)」節點邏輯,簡化了可靠編碼代理的開發過程。

下一步行動

在您的 Claude Code 工作流程中整合「/goals」,透過定義具體且可測試的完成條件,以減少代理程式「誤判任務完成」的錯誤。

誰應關注:Developers & AI Engineers

關鍵要點

  • 引入雙模型架構:一個負責執行,另一個負責評估。
  • 預設使用 Haiku 作為評估器,在允許任務終止前檢查是否滿足特定條件。
  • 無需在代理迴圈中編寫複雜的自定義可觀測性或第三方評估邏輯。
  • 確保代理程式持續工作,直到明確滿足定義的目標條件為止。

🧠 深度解析

Web-grounded analysis with 21 cited sources.

🔑 增強重點摘要

  • Haiku 4.5模型於2025年10月15日發布,其設計旨在提供速度與成本效益,在代理程式編碼評估中能達到Sonnet 4.5約90%的性能,但成本僅為其三分之一,速度則快兩倍以上,使其成為評估任務的理想選擇。
  • 「/goals」功能是透過Claude Code 2.1.139版本於2026年5月12日左右引入的,它支援互動模式、-p模式和遠端控制模式,並提供即時疊加顯示已用時間、回合數和Token消耗等任務進度資訊。
  • Anthropic的策略是採用分層、互聯的模型家族,其中Sonnet 4.5被定位為「大腦」負責協調,而Haiku 4.5則作為「執行器」處理子任務,這種多代理協作模式是其代理工作流程的核心。
  • Claude Code本身被描述為一個通用的代理程式框架,不僅限於編碼,它能夠無限期地執行任務、存取網路、執行程式碼和管理檔案,展現了超越單純編碼工具的廣泛應用潛力。
  • 「/goals」功能的推出,是Anthropic為解決生產環境中代理系統瓶頸的努力之一,這些瓶頸包括跨會話記憶衰退以及在缺乏持續人工審查下難以確保輸出品質的問題。
📊 競品分析▸ Show
特性/模型Anthropic Claude Haiku 4.5Anthropic Claude Sonnet 4.6Anthropic Claude Opus 4.6OpenAI GPT 5.4
角色執行器/子代理實施者/複雜代理協調者/規劃綜合能力
SWE-bench Verified73.3%79.6%81.4%80%
輸入價格 (每百萬Token)$1.00$3.00$5.00N/A (GPT-5.2價格為$1.75)
輸出價格 (每百萬Token)$5.00$15.00$25.00N/A (GPT-5.2價格為$14)
評估方法雙模型架構 (Haiku評估)雙模型架構 (Haiku評估)雙模型架構 (Haiku評估)外部框架評估 (如MLflow, DeepEval)

🛠️ 技術深入

  • Claude Code採用三層記憶體架構:一個持久化的memory.md檔案用於長期記憶,一個基於grep的主動搜尋層用於即時程式碼庫檢索,以及一個未發布的背景程序Chyros daemon用於持續背景索引。
  • Haiku 4.5模型被選為評估器,因其針對速度和成本效益進行了優化,在代理程式編碼評估中能達到Sonnet 4.5約90%的性能,但成本僅為其三分之一,速度則快兩倍以上。
  • Claude Code的代理迴圈核心流程包括:(1) 收集上下文並推理,(2) 採取行動,(3) 驗證結果,並重複此過程,而「/goals」功能很可能整合到「驗證結果」步驟中。
  • 為了減少感知延遲,Claude Code支援工具的平行執行,例如在Claude生成回應的同時讀取檔案。
  • 代理程式安全機制包括在修改檔案或執行命令前需要明確許可,並使用內建分類器自動區分安全與潛在風險操作。

🔮 前景展望AI analysis grounded in cited sources

AI代理的自主性和可靠性將顯著提升。
透過自動化任務評估和雙模型驗證,代理程式能更有效地自我修正並確保目標達成,減少人類干預的需求。
開發者將能更專注於高層次架構與產品思維。
代理程式處理重複性任務和自我評估的能力增強,使得工程師可以將精力轉移到更具創造性和戰略性的工作上。
多模型協作將成為AI代理系統的標準配置。
Haiku作為輕量級評估模型的成功應用,證明了不同模型在代理工作流程中扮演特定角色的效率和成本效益。

時間線

2023-03
Claude (AI聊天機器人) 初次發布
2024-03
Claude 3模型家族 (Haiku, Sonnet, Opus) 推出,具備多模態能力
2025-02
Claude Code (代理式命令列工具) 初次發布預覽版
2025-05
Claude Code 與 Claude 4 同步全面上市
2025-10-15
Claude Haiku 4.5 發布,針對速度和成本效益進行優化
2026-05-12
Claude Code 2.1.139 發布,引入「/goal」命令
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: VentureBeat