⚛️較早收集於 63m

Claude 4.8 發布:部分能力超越 Mythos 並支援多智能體並行

Claude 4.8 發布:部分能力超越 Mythos 並支援多智能體並行
PostLinkedIn
⚛️閱讀原文: 量子位

💡Claude 4.8 帶來了大規模多智能體工作流支援,效能表現可能超越當前業界領先模型。

⚡ 30-Second TL;DR

有什麼變化

效能基準測試顯示 Claude 4.8 在關鍵領域超越了 Mythos。

為什麼重要

此更新顯著降低了構建自主智能體工作流的門檻。開發者現在可以部署複雜的多步驟系統,並確保其在長時間內穩定運行。

下一步行動

將新的子智能體協調 API 整合到您現有的智能體框架中,以測試其在多步驟、長時間任務上的效能表現。

誰應關注:Developers & AI Engineers

關鍵要點

  • 效能基準測試顯示 Claude 4.8 在關鍵領域超越了 Mythos。
  • 引入原生支援,可同時協調數百個子智能體進行任務。
  • 針對長期任務執行進行優化,減少人工介入的需求。

🧠 深度解析

Web-grounded analysis with 27 cited sources.

🔑 增強重點摘要

  • Claude Opus 4.8 於 2026 年 5 月 28 日發布,作為 Anthropic 最強大的通用模型,在多項基準測試中展現了顯著提升,特別是在代理任務方面。
  • 新引入的「動態工作流程」(Dynamic Workflows)功能,允許 Claude Code 在單一會話中啟動數百個並行子智能體,以處理大規模程式碼遷移等複雜問題。
  • 用戶現在可以透過「努力控制」(Effort Control)功能,調整 Claude 處理任務時的計算投入程度,以平衡回應速度、成本與深度。
  • Claude Opus 4.8 在誠實度方面有顯著提升,其程式碼錯誤標記率比 Opus 4.7 低約四倍,且其錯誤對齊行為率已與 Anthropic 最優對齊模型 Claude Mythos Preview 相當。
  • 在多項基準測試中,Claude Opus 4.8 超越了 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro,例如在電腦使用和瀏覽器代理任務的 Online-Mind2Web 測試中得分 84%。
📊 競品分析▸ Show
特性/模型Claude Opus 4.8 (Anthropic)GPT-5.5 (OpenAI)Gemini 3.1 Pro (Google)
發布日期2026年5月28日(已發布,具體日期未詳述,但與Claude 4.8同期競爭)(已發布,具體日期未詳述,但與Claude 4.8同期競爭)
基準測試 (SWE-bench Pro)69.2%58.6%(未提供直接比較數據)
基準測試 (Online-Mind2Web)84% (領先Opus 4.7和GPT-5.5)(低於Claude Opus 4.8)(低於Claude Opus 4.8)
基準測試 (Terminal-Bench 2.1)74.6%78.2% (領先)(未提供直接比較數據)
多智能體支援原生支援數百個子智能體並行,具備「動態工作流程」(未明確提及原生並行數百個子智能體)(Google I/O強調代理功能,但未詳述並行規模)
定價 (每百萬Token)輸入:$5,輸出:$25 (標準模式)輸入:$5,輸出:$30輸入:$2,輸出:$12 (200K以下)
快速模式定價輸入:$10,輸出:$50 (比舊版快3倍且便宜3倍)(未明確提及類似快速模式定價)(未明確提及類似快速模式定價)
可用平台Anthropic平台、Amazon Bedrock、Google Cloud、Microsoft Foundry(通常透過OpenAI API及Azure OpenAI服務)(通常透過Google Cloud Vertex AI)
Mythos模型Anthropic的更高階模型,專注網路安全,目前為受限預覽版,預計未來幾週內推出通用版本。OpenAI的GPT-5.4-Cyber具有可比能力。Google的Big Sleep具有可比能力。

🛠️ 技術深入

  • 模型架構:Claude Opus 4.8 採用先進的 Transformer 架構,透過對科學文獻、程式碼庫、創意寫作和對話數據等多元數據集進行廣泛訓練而精煉而成。
  • 上下文窗口:在 Claude API、Amazon Bedrock 和 Vertex AI 上預設支援 100 萬個 Token 的上下文窗口,在 Microsoft Foundry 上為 20 萬個 Token。
  • 多智能體實現:透過「動態工作流程」功能,Claude 可以規劃任務並在單一會話中運行數百個並行子智能體。此架構包含一個協調智能體負責任務分解,以及多個專業智能體執行特定職責,它們透過共享任務系統進行溝通,每個智能體在自己的上下文窗口中操作,實現上下文隔離。
  • 訓練方法:模型訓練結合了人類回饋強化學習 (RLHF),以確保其回應符合人類偏好和道德準則,並維持 Anthropic 所重視的安全特性。
  • 誠實度與對齊:Opus 4.8 在誠實度方面顯著提升,其程式碼錯誤標記率比 Opus 4.7 低約四倍,且錯誤對齊行為率與 Claude Mythos Preview 相當。
  • API 功能:Messages API 現在支援在對話中插入系統訊息 (system entries),允許開發者在不中斷提示快取的情況下更新指令,從而降低代理循環的輸入成本。
  • 努力控制:用戶可以調整模型在回應任務時的計算「努力」程度,從而影響處理速度、成本和結果的深度與徹底性。
  • 多模態能力:Claude Opus 4.8 支援文字、圖像和檔案輸入,並輸出文字。

🔮 前景展望AI analysis grounded in cited sources

AI代理系統的開發與部署將大幅加速。
Claude 4.8 強大的多智能體並行處理能力和優化的長期任務執行,將降低開發複雜代理系統的門檻,並提高其可靠性。
企業級AI應用將更廣泛地整合複雜的自動化工作流程。
透過「動態工作流程」和「努力控制」等功能,企業能更精確地管理成本與效能,將AI應用於大規模的程式碼遷移、數據分析及專業知識工作。
AI模型在網路安全領域的應用將迎來重大突破。
Claude 4.8 在誠實度和對齊方面的提升,以及 Anthropic 即將推出的 Mythos 級模型,預示著 AI 在發現和修復漏洞方面的能力將遠超人類。

時間線

2021
Anthropic 成立,專注於 AI 安全和「憲法式 AI」
2023-03
Claude 1 和 Claude Instant 發布,作為 Anthropic 的首批公開 AI 模型
2024-03
Claude 3 系列 (Haiku, Sonnet, Opus) 發布,引入多模態支援
2025-05
Claude 4 系列 (Opus 4 & Sonnet 4) 發布,專為代理 AI 時代設計
2026-04
Claude Managed Agents 推出公開測試版,Claude Mythos Preview 宣布為受限研究預覽版
2026-05
Claude Opus 4.8 發布,增強代理能力並支援多智能體並行處理
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位