🐯較早收集於 11m

Anthropic 發布 Claude Opus 4.8,新增動態工作流功能

Anthropic 發布 Claude Opus 4.8,新增動態工作流功能
PostLinkedIn
🐯閱讀原文: 虎嗅

💡Claude Opus 4.8 引入了多智能體編排與推理控制功能,正在改變我們構建複雜 AI 應用程式的方式。

⚡ 30-Second TL;DR

有什麼變化

Opus 4.8 提升了編碼準確性,並減少了在不確定情況下的幻覺。

為什麼重要

動態工作流的引入顯著降低了自動化大規模代碼遷移和複雜軟體工程任務的門檻。這標誌著 AI 正向能夠自主管理多步驟、長時間項目的智能體方向發展。

下一步行動

在 Claude Code 中針對複雜的重構任務測試新的「動態工作流」,以評估其管理多智能體編排的能力。

誰應關注:Developers & AI Engineers

關鍵要點

  • Opus 4.8 提升了編碼準確性,並減少了在不確定情況下的幻覺。
  • 動態工作流(Dynamic Workflows)使 Claude 能夠編排數百個子智能體,以處理複雜且耗時的工程任務。
  • 新增「努力控制」(effort control)功能,允許用戶調整推理算力以平衡回答質量與響應速度。
  • 模型在性能升級的同時維持原有的定價標準。

🧠 深度解析

Web-grounded analysis with 32 cited sources.

🔑 增強重點摘要

  • Claude Opus 4.8 的快速模式速度提升 2.5 倍,成本比先前模型降低三倍,輸入每百萬 token 價格為 10 美元,輸出為 50 美元。
  • Opus 4.8 在智能體編碼方面表現顯著提升,SWE-bench Pro 基準測試得分為 69.2%(Opus 4.7 為 64.3%),並在 USAMO 2026 數學推理測試中達到 96.7%(Opus 4.7 為 69.3%),同時在 Super-Agent 和 Legal Agent 基準測試中領先。
  • 該模型展現出更高的「誠實度」,其在生成程式碼時發現錯誤並標記不確定性的可能性比前身高出約四倍,減少了提出無根據主張的情況。
  • Anthropic 計劃在未來幾週內發布比 Opus 更高智慧的「Mythos 級模型」,目前這些模型已透過 Project Glasswing 針對網路安全工作進行私人預覽。
  • 動態工作流功能(目前為研究預覽版)允許 Claude Code 規劃並同時運行數百個子智能體,以執行大規模程式碼庫遷移等複雜工程任務,處理數十萬行程式碼。
📊 競品分析▸ Show
功能/基準Anthropic Claude Opus 4.8OpenAI GPT-5.5Google Gemini 3.1 Pro / 3.5 Pro
發布日期2026-05-282026-05-28 (推測,作為 Opus 4.8 競爭對手)2026-05-28 (推測,作為 Opus 4.8 競爭對手,Gemini 3.5 Pro 預計將有智能體改進)
編碼準確性 (SWE-bench Pro)69.2%58.6%54.2% (Gemini 3.1 Pro)
智能體基準 (Super-Agent)完成所有案例,超越先前 Opus 模型和 GPT-5.5被 Opus 4.8 超越無直接數據,但 Gemini 3.5 Pro 預計將有智能體改進
終端/CLI 工作流表現良好,但落後於 GPT-5.5領先 Opus 4.8無直接數據
多模態能力支援 PDF、圖表等非結構化內容推理,成本比 Opus 4.7 降低 61%無直接數據無直接數據
動態工作流 (多智能體協作)支援數百個平行子智能體,處理大規模工程任務 (研究預覽)需外部框架如 AutoGen需外部框架如 CrewAI, LangGraph
努力控制 (推理強度)允許用戶調整推理算力以平衡質量與速度 (低、中、高、最大)無直接數據類似的「參與度」控制
標準模式定價 (輸入/輸出)$5 / MTok 輸入, $25 / MTok 輸出比 Opus 4.8 更高$10 / MTok 輸入, $50 / MTok 輸出 (Fast mode)
快速模式定價 (輸入/輸出)$10 / MTok 輸入, $50 / MTok 輸出 (2.5倍速度,成本降低3倍)無直接數據無直接數據

🛠️ 技術深入

  • 動態工作流 (Dynamic Workflows):這項功能透過 Claude 編寫的 JavaScript 腳本來實現,該腳本負責大規模協調子智能體。一個運行時在後台執行此腳本,使主要會話保持響應。它能夠在單一會話中運行多達 16 個並行智能體,並在每次運行中最多處理 1,000 個智能體。工作流的規劃被轉化為程式碼,而不是直接進入 Claude 的上下文視窗,中間結果儲存在腳本變數中,從而將 Claude 的上下文保留給最終答案。此功能可在 Claude Code 的 CLI、桌面應用程式和 VS Code 擴展中用於企業、團隊和 Max 方案。
  • 努力控制 (Effort Control):此參數允許用戶控制 Claude 在響應請求時花費 token 的積極程度,從而平衡響應的徹底性、速度和成本。它影響文字響應、工具調用、函數參數和擴展思考。預設為「高努力」,用戶可選擇「額外」(xhigh) 或「最大」以在困難任務中獲得更佳結果,但會消耗更多 token。此功能取代了 Opus 4.6 和 Sonnet 4.6 中的 budget_tokens
  • 自適應思考 (Adaptive Thinking):Claude Opus 4.8 採用自適應思考,僅在模型判斷需要時才觸發推理。對於簡單的查詢和短的智能體步驟,它會直接響應;對於複雜的多步驟問題,它會在回答前進行推理,從而減少雙模態工作負載中不必要的思考 token 消耗。
  • 上下文視窗 (Context Window):Claude Opus 4.8 支援 100 萬個 token 的上下文視窗。

🔮 前景展望AI analysis grounded in cited sources

Mythos 級模型將顯著提升 AI 能力,特別是在網路安全等高風險領域。
這些模型被描述為擁有「比 Opus 更高的智慧」,目前正透過 Project Glasswing 進行網路安全工作的私人預覽,顯示其先進能力和專業應用潛力。
大型語言模型內建的多智能體協作功能將加劇與外部工作流平台的競爭。
Anthropic 的「動態工作流」功能將多智能體協作直接整合到 Claude Code 中,可能降低對 LangGraph 或 CrewAI 等第三方工具的需求,尤其是在複雜工程任務方面。
細粒度的努力控制將推動對進階 AI 成本管理和可觀察性工具的需求。
可配置的「努力模式」增加了企業優化開支所需的儀器表面,為可觀察性和成本管理供應商創造了機會。

時間線

2021
Anthropic 成立,專注於 AI 安全和「憲法式 AI」
2023-03
Claude 1 和 Claude Instant 發布
2023-07
Claude 2 發布,上下文視窗擴展至 100,000 個 token
2024-03
Claude 3 系列 (Haiku, Sonnet, Opus) 發布,引入多模態圖像支援
2025-11
Claude Opus 4.5 發布,提升編碼、智能體和企業工作能力
2026-02
Claude Opus 4.6 發布,改進規劃、智能體可靠性,並首次提供 1M token 上下文視窗(測試版)
2026-04
Claude Opus 4.7 發布,專為進階軟體工程、複雜多步驟任務和視覺處理設計
2026-05-28
Claude Opus 4.8 發布,引入動態工作流和努力控制功能
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅