🔥較早收集於 45m

Claude Opus 4.6 與 Sonnet 4.6 上線百萬上下文窗口

Claude Opus 4.6 與 Sonnet 4.6 上線百萬上下文窗口
PostLinkedIn
🔥閱讀原文: 36氪
#context-window#anthropic#pricing-updateclaude-opus-4.6-&-sonnet-4.6anthropicclaude-opus-4.6claude-sonnet-4.6

💡百萬令牌標準價格—大幅降低巨量上下文 AI 應用成本!

⚡ 30-Second TL;DR

有什麼變化

兩模型完整 100 萬令牌上下文窗口以標準定價提供

為什麼重要

降低長上下文 AI 任務如 RAG 及程式碼分析的成本,提升 Claude 相對於長上下文溢價競爭對手的競爭力。

下一步行動

使用 100 萬令牌提示測試 Claude Opus 4.6 API 進行長文件摘要。

誰應關注:Developers & AI Engineers

關鍵要點

  • 兩模型完整 100 萬令牌上下文窗口以標準定價提供
  • Opus 4.6:每百萬令牌 5 美元輸入、25 美元輸出;Sonnet 4.6:3/15 美元
  • 無長上下文額外費用;統一費率及完整速率限制

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Claude Opus 4.6 在 Terminal-Bench 2.0 代理編碼評估和 Humanity’s Last Exam 多學科推理測試中取得業界領先成績[5]
  • Claude Sonnet 4.6 在 Claude Code 測試中,用戶偏好其勝過 Sonnet 4.5 達 70% 時間,並勝過 Opus 4.5 達 59% 時間,特別在減少幻覺和多步驟任務執行上表現優異[2]
  • 兩模型引入自適應思考和努力控制機制,允許根據任務難度動態調整計算資源,提升 Sonnet 在高難任務的靈活性[1]
  • Opus 4.6 在 100 萬令牌 MRCR v2 針尖測試中得分 76%,遠高於 Sonnet 4.5 的 18.5%,顯著改善長上下文效能衰減問題[5]

🛠️ 技術深入

  • 兩模型共享 100 萬令牌上下文窗口架構升級,能處理完整程式碼庫、大型法律文件或多年財務報告[4]
  • 引入自適應思考(adaptive thinking)和努力參數(effort controls),允許動態調整推理計算預算,而非固定最大值[1]
  • Opus 4.6 在長多步驟代理工作流中表現最佳,特別擅長工具呼叫和自動化代理操作[4][5]
  • Sonnet 4.6 在電腦使用技能和編排評估(orchestration evals)上有重大進步,適合高吞吐量辦公任務[2]
  • Opus 4.6 在 8-needle 1M MRCR v2 測試中證明長上下文無效能衰減,解決「上下文腐敗」問題[5]

🔮 前景展望AI analysis grounded in cited sources

1M 上下文窗口標準化將加速企業級 AI 代理採用
允許單一提示處理海量資料如完整程式碼庫,大幅降低開發者對多輪對話或外部記憶系統的依賴[4][5]
自適應思考控制將重塑模型選擇邏輯
Sonnet 可透過努力參數向上擴展至 Opus 等級效能,同時保持成本優勢,模糊中高階模型界線[1][2]
長上下文可靠性提升將推動自主代理商業化
Opus 4.6 在針尖測試中 76% 得分證明能有效利用百萬令牌上下文,適合無監督多步驟工作流[5]

時間線

2025-11
Claude Opus 4.5 發佈,確立前沿模型基準
2026-03
Claude Sonnet 4.6 與 Opus 4.6 同步推出,帶來 1M 上下文窗口和自適應思考控制
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 36氪

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。