🔢較早收集於 90m

Anthropic 發布旗艦模型 Claude Opus 4.8

PostLinkedIn
🔢閱讀原文: 少数派

💡Anthropic 全新旗艦模型登場,立即評估其是否能超越您目前的 LLM 技術堆疊。

⚡ 30-Second TL;DR

有什麼變化

Anthropic 發布了全新的旗艦模型 Claude Opus 4.8

為什麼重要

Claude Opus 4.8 的發布可能會改變高效能 LLM 的競爭格局,並對現有的基準測試構成挑戰。

下一步行動

將 Claude Opus 4.8 與您當前的生產工作負載進行評估,以確定性能提升是否值得遷移。

誰應關注:Developers & AI Engineers

關鍵要點

  • Anthropic 發布了全新的旗艦模型 Claude Opus 4.8
  • 該模型代表了 Claude 高階系列中的最新迭代
  • Intel 同時宣布了全新的 Arc G 系列處理器

🧠 深度解析

Web-grounded analysis with 15 cited sources.

🔑 增強重點摘要

  • Claude Opus 4.8 在多項基準測試中超越了競爭對手 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro,尤其在代理編碼(SWE-Bench Pro)和多學科推理方面表現突出。
  • 該模型在 Claude Code 中引入了「動態工作流程」功能,使其能夠透過協調數百個並行子代理來處理大規模的複雜編碼任務。
  • Opus 4.8 的「快速模式」成本比以前的模型便宜三倍,同時能以 2.5 倍的速度運行,適用於對延遲敏感的生產工作負載。
  • Anthropic 強調 Opus 4.8 顯著提升了「誠實性」和判斷力,減少了模型產生錯誤程式碼或提出無根據主張的可能性,並能更好地標示不確定性。
  • 使用者現在可以在 claude.ai 和 Cowork 平台上控制 Claude 執行任務時投入的「努力程度」,這會影響其代幣使用量和成本。
📊 競品分析▸ Show
特性/指標Claude Opus 4.8OpenAI GPT-5.5Google Gemini 3.1 Pro
發布日期2026年5月28日2026年5月28日之前 (作為比較基準)2026年5月28日之前 (作為比較基準)
輸入代幣價格 (每百萬)5 美元 (標準模式)未明確提供,但據稱在常規模式下較高未明確提供
輸出代幣價格 (每百萬)25 美元 (標準模式)未明確提供未明確提供
快速模式價格 (每百萬輸入/輸出)10 美元 / 50 美元 (快2.5倍,便宜3倍)未明確提供未明確提供
代理編碼 (SWE-Bench Pro)69.2%58.6%54.2%
代理終端編碼 (Terminal-Bench 2.1)74.6%78.2% (領先)未明確提供
多學科推理 (Humanity's Last Exam)49.8% (無工具), 57.9% (有工具) (最高分)未明確提供未明確提供
代理電腦使用 (OSWorld-Verified)83.4% (微幅領先)未明確提供未明確提供
知識工作任務 (GDPval-AA)189017691314
代理金融分析53.9%未明確提供未明確提供
主要新功能動態工作流程、努力程度控制、更佳誠實性未明確提供未明確提供
上下文窗口100萬代幣 (預設)據稱在272K輸入代幣以下表現強勁未明確提供
多模態能力可直接處理PDF、圖表等非結構化內容未明確提供未明確提供

🛠️ 技術深入

  • 上下文窗口: Claude Opus 4.8 預設支援 100 萬個代幣的上下文窗口,最大輸出為 128,000 個代幣,可在 Claude API、Amazon Bedrock 和 Vertex AI 上使用。
  • 多模態能力: 該模型具備多模態處理能力,能夠直接對 PDF、圖表和其他非結構化內容進行推理。
  • 部署平台: Claude Opus 4.8 可透過 Claude 平台原生使用,並在 Amazon Web Services (AWS Bedrock)、Google Cloud (Vertex AI) 和 Microsoft Foundry 上提供。
  • 可靠性與判斷力: 模型在代理任務中展現出更高的可靠性和更敏銳的判斷力,在程式碼審查中發現錯誤的可能性比 Opus 4.7 低約四倍,並減少了無根據的主張。

🔮 前景展望AI analysis grounded in cited sources

企業級AI應用將加速發展。
Opus 4.8 在代理編碼、知識工作和多階段自主任務方面表現出色,且具備更高的可靠性和判斷力,使其成為企業級AI解決方案的理想選擇,特別是在金融服務、法律和生命科學等高風險領域。
AI代理的複雜性和自主性將顯著提升。
模型的「動態工作流程」功能允許其協調數百個並行子代理來處理大規模問題,並能利用記憶學習跨會話,減少人工監督,推動更複雜的代理工作流程。
Anthropic 將在短期內發布更強大的「Mythos級」模型。
Anthropic 已預告即將推出比 Opus 更具智能的新模型類別,目前少數組織正在進行網路安全工作測試,預計在未來幾週內向所有客戶發布,這預示著AI能力的進一步飛躍。

時間線

2021-01
Anthropic 成立,專注於 AI 安全研究。
2022-12
Anthropic 發表「憲法式AI (Constitutional AI)」論文。
2023-03
Claude 1 作為 Anthropic 首個公開 AI 模型發布。
2023-07
Claude 2 發布,大幅擴展上下文窗口至 100,000 個代幣。
2024-03
Claude 3 模型家族(Haiku, Sonnet, Opus)推出,引入多模態圖像支援。
2026-05
Anthropic 發布旗艦模型 Claude Opus 4.8。

📰 事件追蹤

📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 少数派