來源最新收集於 5h

Anthropic 推出更快、更便宜的 Opus 5.5

閱讀原文: New York Times Technology
#model-safety#inference-cost#model-evaluation

更便宜、更快速的 Opus 模型,宣稱取得 Anthropic 迄今最佳內部安全成績。

30 秒速覽

有什麼變化

Opus 5.5 定位為速度更快、成本更低的模型。

為什麼重要

成本更低且速度更快的 Opus 模型,可能擴大 Anthropic 系統在正式應用中的使用。其安全性主張也可能影響開發者如何同時評估模型能力與風險控管。

下一步行動

在流量最高的提示上測試 Opus 5.5,並與目前模型比較延遲、成本、拒答行為與任務準確度。

誰應關注:Developers & AI Engineers

關鍵要點

  • Opus 5.5 定位為速度更快、成本更低的模型。
  • Anthropic 表示該模型在嚴格的內部安全測試中創下迄今最佳表現。
  • 這次發布正值外界持續爭論先進 AI 模型安全性的時期。
關鍵數字20%40%30%60%

深度解析

背景與延伸:來自公開資料,非原文內容。引用 16 個來源。

增強重點摘要

  • Opus 5.5 牌價較 Opus 5 降低 20%,達到每百萬輸入 Token 4 美元、輸出 Token 20 美元,且因輸出精簡度提升,企業工作負載總執行成本估計降低約 40%。
  • 推論速度較 Opus 5 提升超過 30%,同時 Prompt 快取讀取費用大幅下調 60% 至每百萬 Token 0.20 美元,顯著降低代理程式編程的重複上下文成本。
  • 基準測試方面,Opus 5.5 在 Terminal-Bench 4.0 取得 66.4%(優於 OpenAI GPT-6 Astra 的 57.9%),並在涵蓋 44 種職業任務的 GDPval-AA v2.1 達到 1,846 分,超越自家高價旗艦 Claude Fable 5.1。
  • 經 METR 與 Frontier Design 外部測試,該模型試圖繞過安全防護限制或執行難以逆轉操作的機率較 Opus 5 和 Mythos 5.1 降低了 85%。
  • 此次發布發生於 Anthropic 執行長 Dario Amodei 發表呼籲業界「放緩前沿擴展節奏」專文的 10 天後,亦正值公司預期於秋季推動首次公開發行(IPO)前夕,用以鎖定企業開發者並因應 OpenAI 同日推出的 GPT-6 Sol 與 Luna。

競品分析

Claude Opus 5.5
輸入定價 (每百萬 Token)
$4.00
輸出定價 (每百萬 Token)
$20.00
Terminal-Bench 4.0
66.4%
GDPval-AA v2.1
1,846
Claude Fable 5.1
輸入定價 (每百萬 Token)
$10.00
輸出定價 (每百萬 Token)
$50.00
Terminal-Bench 4.0
未揭露(低於 Opus 5.5)
GDPval-AA v2.1
1,735
Claude Opus 5
輸入定價 (每百萬 Token)
$5.00
輸出定價 (每百萬 Token)
$25.00
Terminal-Bench 4.0
未揭露
GDPval-AA v2.1
1,708
OpenAI GPT-6 Astra
輸入定價 (每百萬 Token)
未揭露
輸出定價 (每百萬 Token)
未揭露
Terminal-Bench 4.0
57.9%
GDPval-AA v2.1
未揭露

技術深入

  • 定價與成本結構:API 牌價為輸入每百萬 Token 4 美元、輸出每百萬 Token 20 美元;Prompt 快取讀取費用調降至每百萬 Token 0.20 美元,快取寫入費用降至每百萬 Token 5 美元。
  • 推論效能:回應生成速度較前代 Opus 5 提高超過 30%,並透過減少任務完成所需 Token 數量降低推論冗餘。
  • 基準測試表現:於終端代碼代理評測 Terminal-Bench 4.0 取得 66.4% 分數;於跨 44 項專業工作評測 GDPval-AA v2.1 取得 1,846 分。
  • 安全性與邊界遵從:經 METR 和 Frontier Design 驗證,越界繞過操作限制及執行不可逆操作之傾向較 Opus 5 與 Mythos 5.1 減少 85%。

前景展望基於引用來源的 AI 分析

企業級 AI 代理市場將加速由純參數規模轉向推論快取成本效益導向
Opus 5.5 將快取讀取價格降至每百萬 Token 0.20 美元並提升精簡度,迫使競爭對手必須透過更極致的快取定價與 Token 經濟學爭奪長上下文開發者。
前沿模型發表主軸將轉變為「效率與治理優先」而非純運算力軍備競賽
在 Amodei 呼籲放緩前沿擴展與外部機構對邊界對齊驗證的雙重推動下,頂級廠商將優先宣傳對齊指標與邊界遵循率以應對監管審查。

時間線

2026-09
Anthropic 執行長發表專文呼籲業界放緩前沿擴展以健全安全治理體系
2026-09
Anthropic 正式推出 Claude Opus 5.5,開創 Claude 5.5 家族架構

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: New York Times Technology

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。