⚛️量子位•較早收集於 63m
Claude 4.8 發布:部分能力超越 Mythos 並支援多智能體並行

💡Claude 4.8 帶來了大規模多智能體工作流支援,效能表現可能超越當前業界領先模型。
⚡ 30-Second TL;DR
有什麼變化
效能基準測試顯示 Claude 4.8 在關鍵領域超越了 Mythos。
為什麼重要
此更新顯著降低了構建自主智能體工作流的門檻。開發者現在可以部署複雜的多步驟系統,並確保其在長時間內穩定運行。
下一步行動
將新的子智能體協調 API 整合到您現有的智能體框架中,以測試其在多步驟、長時間任務上的效能表現。
誰應關注:Developers & AI Engineers
關鍵要點
- •效能基準測試顯示 Claude 4.8 在關鍵領域超越了 Mythos。
- •引入原生支援,可同時協調數百個子智能體進行任務。
- •針對長期任務執行進行優化,減少人工介入的需求。
🧠 深度解析
Web-grounded analysis with 27 cited sources.
🔑 增強重點摘要
- •Claude Opus 4.8 於 2026 年 5 月 28 日發布,作為 Anthropic 最強大的通用模型,在多項基準測試中展現了顯著提升,特別是在代理任務方面。
- •新引入的「動態工作流程」(Dynamic Workflows)功能,允許 Claude Code 在單一會話中啟動數百個並行子智能體,以處理大規模程式碼遷移等複雜問題。
- •用戶現在可以透過「努力控制」(Effort Control)功能,調整 Claude 處理任務時的計算投入程度,以平衡回應速度、成本與深度。
- •Claude Opus 4.8 在誠實度方面有顯著提升,其程式碼錯誤標記率比 Opus 4.7 低約四倍,且其錯誤對齊行為率已與 Anthropic 最優對齊模型 Claude Mythos Preview 相當。
- •在多項基準測試中,Claude Opus 4.8 超越了 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro,例如在電腦使用和瀏覽器代理任務的 Online-Mind2Web 測試中得分 84%。
📊 競品分析▸ Show
| 特性/模型 | Claude Opus 4.8 (Anthropic) | GPT-5.5 (OpenAI) | Gemini 3.1 Pro (Google) |
|---|---|---|---|
| 發布日期 | 2026年5月28日 | (已發布,具體日期未詳述,但與Claude 4.8同期競爭) | (已發布,具體日期未詳述,但與Claude 4.8同期競爭) |
| 基準測試 (SWE-bench Pro) | 69.2% | 58.6% | (未提供直接比較數據) |
| 基準測試 (Online-Mind2Web) | 84% (領先Opus 4.7和GPT-5.5) | (低於Claude Opus 4.8) | (低於Claude Opus 4.8) |
| 基準測試 (Terminal-Bench 2.1) | 74.6% | 78.2% (領先) | (未提供直接比較數據) |
| 多智能體支援 | 原生支援數百個子智能體並行,具備「動態工作流程」 | (未明確提及原生並行數百個子智能體) | (Google I/O強調代理功能,但未詳述並行規模) |
| 定價 (每百萬Token) | 輸入:$5,輸出:$25 (標準模式) | 輸入:$5,輸出:$30 | 輸入:$2,輸出:$12 (200K以下) |
| 快速模式定價 | 輸入:$10,輸出:$50 (比舊版快3倍且便宜3倍) | (未明確提及類似快速模式定價) | (未明確提及類似快速模式定價) |
| 可用平台 | Anthropic平台、Amazon Bedrock、Google Cloud、Microsoft Foundry | (通常透過OpenAI API及Azure OpenAI服務) | (通常透過Google Cloud Vertex AI) |
| Mythos模型 | Anthropic的更高階模型,專注網路安全,目前為受限預覽版,預計未來幾週內推出通用版本。 | OpenAI的GPT-5.4-Cyber具有可比能力。 | Google的Big Sleep具有可比能力。 |
🛠️ 技術深入
- 模型架構:Claude Opus 4.8 採用先進的 Transformer 架構,透過對科學文獻、程式碼庫、創意寫作和對話數據等多元數據集進行廣泛訓練而精煉而成。
- 上下文窗口:在 Claude API、Amazon Bedrock 和 Vertex AI 上預設支援 100 萬個 Token 的上下文窗口,在 Microsoft Foundry 上為 20 萬個 Token。
- 多智能體實現:透過「動態工作流程」功能,Claude 可以規劃任務並在單一會話中運行數百個並行子智能體。此架構包含一個協調智能體負責任務分解,以及多個專業智能體執行特定職責,它們透過共享任務系統進行溝通,每個智能體在自己的上下文窗口中操作,實現上下文隔離。
- 訓練方法:模型訓練結合了人類回饋強化學習 (RLHF),以確保其回應符合人類偏好和道德準則,並維持 Anthropic 所重視的安全特性。
- 誠實度與對齊:Opus 4.8 在誠實度方面顯著提升,其程式碼錯誤標記率比 Opus 4.7 低約四倍,且錯誤對齊行為率與 Claude Mythos Preview 相當。
- API 功能:Messages API 現在支援在對話中插入系統訊息 (system entries),允許開發者在不中斷提示快取的情況下更新指令,從而降低代理循環的輸入成本。
- 努力控制:用戶可以調整模型在回應任務時的計算「努力」程度,從而影響處理速度、成本和結果的深度與徹底性。
- 多模態能力:Claude Opus 4.8 支援文字、圖像和檔案輸入,並輸出文字。
🔮 前景展望AI analysis grounded in cited sources
AI代理系統的開發與部署將大幅加速。
Claude 4.8 強大的多智能體並行處理能力和優化的長期任務執行,將降低開發複雜代理系統的門檻,並提高其可靠性。
企業級AI應用將更廣泛地整合複雜的自動化工作流程。
透過「動態工作流程」和「努力控制」等功能,企業能更精確地管理成本與效能,將AI應用於大規模的程式碼遷移、數據分析及專業知識工作。
AI模型在網路安全領域的應用將迎來重大突破。
Claude 4.8 在誠實度和對齊方面的提升,以及 Anthropic 即將推出的 Mythos 級模型,預示著 AI 在發現和修復漏洞方面的能力將遠超人類。
⏳ 時間線
2021
Anthropic 成立,專注於 AI 安全和「憲法式 AI」
2023-03
Claude 1 和 Claude Instant 發布,作為 Anthropic 的首批公開 AI 模型
2024-03
Claude 3 系列 (Haiku, Sonnet, Opus) 發布,引入多模態支援
2025-05
Claude 4 系列 (Opus 4 & Sonnet 4) 發布,專為代理 AI 時代設計
2026-04
Claude Managed Agents 推出公開測試版,Claude Mythos Preview 宣布為受限研究預覽版
2026-05
Claude Opus 4.8 發布,增強代理能力並支援多智能體並行處理
📎 來源 (27)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- reddit.com
- tradingkey.com
- anthropic.com
- 9to5google.com
- anthropic.com
- venturebeat.com
- reddit.com
- digitalapplied.com
- openrouter.ai
- amazon.com
- bain.com
- eigent.ai
- pluralsight.com
- anthropic.com
- rewarx.com
- claude.com
- epam.com
- medium.com
- artificialanalysis.ai
- taskade.com
- timesofai.com
- mark-whitfield.com
- hidekazu-konishi.com
- github.com
- wavespeed.ai
- medium.com
- amazon.com
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗