🔢少数派•較早收集於 90m
Anthropic 發布旗艦模型 Claude Opus 4.8
💡Anthropic 全新旗艦模型登場,立即評估其是否能超越您目前的 LLM 技術堆疊。
⚡ 30-Second TL;DR
有什麼變化
Anthropic 發布了全新的旗艦模型 Claude Opus 4.8
為什麼重要
Claude Opus 4.8 的發布可能會改變高效能 LLM 的競爭格局,並對現有的基準測試構成挑戰。
下一步行動
將 Claude Opus 4.8 與您當前的生產工作負載進行評估,以確定性能提升是否值得遷移。
誰應關注:Developers & AI Engineers
關鍵要點
- •Anthropic 發布了全新的旗艦模型 Claude Opus 4.8
- •該模型代表了 Claude 高階系列中的最新迭代
- •Intel 同時宣布了全新的 Arc G 系列處理器
🧠 深度解析
Web-grounded analysis with 15 cited sources.
🔑 增強重點摘要
- •Claude Opus 4.8 在多項基準測試中超越了競爭對手 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro,尤其在代理編碼(SWE-Bench Pro)和多學科推理方面表現突出。
- •該模型在 Claude Code 中引入了「動態工作流程」功能,使其能夠透過協調數百個並行子代理來處理大規模的複雜編碼任務。
- •Opus 4.8 的「快速模式」成本比以前的模型便宜三倍,同時能以 2.5 倍的速度運行,適用於對延遲敏感的生產工作負載。
- •Anthropic 強調 Opus 4.8 顯著提升了「誠實性」和判斷力,減少了模型產生錯誤程式碼或提出無根據主張的可能性,並能更好地標示不確定性。
- •使用者現在可以在 claude.ai 和 Cowork 平台上控制 Claude 執行任務時投入的「努力程度」,這會影響其代幣使用量和成本。
📊 競品分析▸ Show
| 特性/指標 | Claude Opus 4.8 | OpenAI GPT-5.5 | Google Gemini 3.1 Pro |
|---|---|---|---|
| 發布日期 | 2026年5月28日 | 2026年5月28日之前 (作為比較基準) | 2026年5月28日之前 (作為比較基準) |
| 輸入代幣價格 (每百萬) | 5 美元 (標準模式) | 未明確提供,但據稱在常規模式下較高 | 未明確提供 |
| 輸出代幣價格 (每百萬) | 25 美元 (標準模式) | 未明確提供 | 未明確提供 |
| 快速模式價格 (每百萬輸入/輸出) | 10 美元 / 50 美元 (快2.5倍,便宜3倍) | 未明確提供 | 未明確提供 |
| 代理編碼 (SWE-Bench Pro) | 69.2% | 58.6% | 54.2% |
| 代理終端編碼 (Terminal-Bench 2.1) | 74.6% | 78.2% (領先) | 未明確提供 |
| 多學科推理 (Humanity's Last Exam) | 49.8% (無工具), 57.9% (有工具) (最高分) | 未明確提供 | 未明確提供 |
| 代理電腦使用 (OSWorld-Verified) | 83.4% (微幅領先) | 未明確提供 | 未明確提供 |
| 知識工作任務 (GDPval-AA) | 1890 | 1769 | 1314 |
| 代理金融分析 | 53.9% | 未明確提供 | 未明確提供 |
| 主要新功能 | 動態工作流程、努力程度控制、更佳誠實性 | 未明確提供 | 未明確提供 |
| 上下文窗口 | 100萬代幣 (預設) | 據稱在272K輸入代幣以下表現強勁 | 未明確提供 |
| 多模態能力 | 可直接處理PDF、圖表等非結構化內容 | 未明確提供 | 未明確提供 |
🛠️ 技術深入
- 上下文窗口: Claude Opus 4.8 預設支援 100 萬個代幣的上下文窗口,最大輸出為 128,000 個代幣,可在 Claude API、Amazon Bedrock 和 Vertex AI 上使用。
- 多模態能力: 該模型具備多模態處理能力,能夠直接對 PDF、圖表和其他非結構化內容進行推理。
- 部署平台: Claude Opus 4.8 可透過 Claude 平台原生使用,並在 Amazon Web Services (AWS Bedrock)、Google Cloud (Vertex AI) 和 Microsoft Foundry 上提供。
- 可靠性與判斷力: 模型在代理任務中展現出更高的可靠性和更敏銳的判斷力,在程式碼審查中發現錯誤的可能性比 Opus 4.7 低約四倍,並減少了無根據的主張。
🔮 前景展望AI analysis grounded in cited sources
企業級AI應用將加速發展。
Opus 4.8 在代理編碼、知識工作和多階段自主任務方面表現出色,且具備更高的可靠性和判斷力,使其成為企業級AI解決方案的理想選擇,特別是在金融服務、法律和生命科學等高風險領域。
AI代理的複雜性和自主性將顯著提升。
模型的「動態工作流程」功能允許其協調數百個並行子代理來處理大規模問題,並能利用記憶學習跨會話,減少人工監督,推動更複雜的代理工作流程。
Anthropic 將在短期內發布更強大的「Mythos級」模型。
Anthropic 已預告即將推出比 Opus 更具智能的新模型類別,目前少數組織正在進行網路安全工作測試,預計在未來幾週內向所有客戶發布,這預示著AI能力的進一步飛躍。
⏳ 時間線
2021-01
Anthropic 成立,專注於 AI 安全研究。
2022-12
Anthropic 發表「憲法式AI (Constitutional AI)」論文。
2023-03
Claude 1 作為 Anthropic 首個公開 AI 模型發布。
2023-07
Claude 2 發布,大幅擴展上下文窗口至 100,000 個代幣。
2024-03
Claude 3 模型家族(Haiku, Sonnet, Opus)推出,引入多模態圖像支援。
2026-05
Anthropic 發布旗艦模型 Claude Opus 4.8。
📎 來源 (15)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰 事件追蹤
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 少数派 ↗