📋較早收集於 4m

Anthropic 開始對新款 Claude Mythos 模型進行紅隊測試

Anthropic 開始對新款 Claude Mythos 模型進行紅隊測試
PostLinkedIn
📋閱讀原文: TestingCatalog

💡Anthropic 基於「Oceanus」檢查點的新模型鎖定程式編寫與網路安全,這是企業採用 AI 的關鍵領域。

⚡ 30-Second TL;DR

有什麼變化

Claude Mythos 源自全新的「Oceanus」檢查點。

為什麼重要

對網路安全與推理的重視,顯示 Anthropic 正將此模型定位於高風險企業與技術工作流程的競爭中。從業者應為程式編寫與安全任務基準測試的潛在變動做好準備。

下一步行動

密切關注 Anthropic 的 API 文件與發布說明,以獲取 Mythos 模型的搶先體驗或候補名單資訊。

誰應關注:Developers & AI Engineers

關鍵要點

  • Claude Mythos 源自全新的「Oceanus」檢查點。
  • 該模型專注於提升推理與程式編寫的專業能力。
  • 目前正進行紅隊測試,以確保其在網路安全應用中的安全性與效能。

🧠 深度解析

Web-grounded analysis with 21 cited sources.

🔑 增強重點摘要

  • Claude Mythos 於 2026 年 4 月 7 日發布,但因其先進的攻擊性網路安全能力而未公開發行;Anthropic 轉而啟動了「Project Glasswing」計畫,向經過審查的組織提供存取權限以用於防禦目的。
  • Mythos Preview 已展現出自主發現並串聯主要作業系統和網路瀏覽器中零日漏洞的能力,甚至能找出經過數十年人工審查仍未被發現的缺陷。
  • 該模型顯著提升了 Anthropic 內部的程式編寫能力,工程師每季度合併的程式碼量增加了 8 倍,且 Mythos 將 Claude Code 在開放式工程任務上的成功率從約 40% 提高到近 70%。
  • Mythos Preview 在逆向工程方面表現出色,能夠從已剝離的二進位檔重建出合理的原始碼,並成功為 2024 年和 2025 年的 Linux 核心 CVE 編寫提權漏洞利用程式。
  • AI 安全研究所 (AISI) 對 Mythos Preview 進行了評估,指出其在多步驟網路攻擊模擬和奪旗 (CTF) 挑戰方面的表現,相較於先前的尖端模型有顯著提升。
📊 競品分析▸ Show
模型/功能Anthropic Claude Opus 4.8 (2026年5月)Anthropic Claude Sonnet 4.6 (2026年2月)OpenAI GPT-5.4 (2026年3月)Google Gemini 1.5 Pro (2024年2月)
能力層級旗艦級,最智能中階,平衡智能與速度旗艦級,最智能旗艦級,多模態
主要優勢複雜推理、程式碼生成、代理工作流程、長時協作、瀏覽器代理程式碼編寫、代理、知識工作、設計任務,接近 Opus 級智能生態系統廣度、推理能力多模態應用、原生視訊/音訊
輸入成本 (每百萬 Token)$5 (標準), $10 (快速模式)$3$2.50 (標準), $0.20 (Nano)$1.25
輸出成本 (每百萬 Token)$25 (標準), $50 (快速模式)$15$15 (標準), $1.25 (Nano)$5.00
上下文視窗100萬 Token100萬 Token272K Token (標準), 1M+ (預覽)100萬 Token
程式碼基準SWE-Bench Verified 領先Opus 級程式碼編寫能力--
發布日期2026年5月28日2026年2月2026年3月2024年2月
特殊功能4倍減少程式碼缺陷,瀏覽器代理---
可用性Anthropic API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft FoundryAnthropic API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry--

🛠️ 技術深入

  • Claude Mythos 採用與其前身截然不同的底層架構,使其具備「無限上下文視窗」、遞歸自我修正和原生系統工具整合等能力。
  • Anthropic 的 Claude Code(Mythos 所增強的系統)採用以「單執行緒主迴圈」(代號 nO)為核心的自主程式編寫代理架構,優先考慮可偵錯性和透明度,而非複雜的多代理群體協調。
  • Claude 模型透過「憲法式 AI」(Constitutional AI) 技術進行訓練,該技術讓模型根據一系列規則進行自我批判和重寫回應,以符合人類價值觀。
  • 紅隊測試過程結合了人工專家探測和自動化大型語言模型攻擊試驗,並透過回饋循環來改進模型修復。
  • Claude Code 代理能夠直接與開發工具互動,例如終端機、檔案系統和 Git 命令。

🔮 前景展望AI analysis grounded in cited sources

AI 驅動的網路攻擊將變得更加複雜和普遍,因此需要大幅增加網路安全投資。
Mythos 自主發現和利用零日漏洞的能力,展示了 AI 網路能力的新門檻,即使其存取受限,也預示著透過其他尖端模型和開源大型語言模型,此類威脅將更廣泛地普及。
Anthropic 將繼續優先考慮其最強大模型的安全性與受控部署,這可能會影響負責任 AI 發布的行業標準。
限制 Mythos 公開發布並啟動 Project Glasswing 的決定,突顯了 Anthropic 致力於降低濫用風險的承諾,為處理高能力尖端 AI 樹立了先例。
人類工程師的角色將進一步轉向架構、產品思維和 AI 代理協調。
隨著 Mythos 等模型顯著提高程式編寫效率和成功率,人類開發者將越來越多地管理和指導 AI 代理,而非執行低階程式編寫任務。

時間線

2021
Anthropic 成立
2022-12
發布「憲法式 AI」論文
2023-03
Claude 1 發布,成為首個公開 AI 模型
2024-03
Claude 3 系列(Haiku、Sonnet、Opus)發布,引入多模態能力
2024-06
Claude 3.5 Sonnet 發布,性能超越 Claude 3 Opus
2026-04
Claude Mythos Preview 宣布(未公開發布),並啟動 Project Glasswing
2026-05
Claude Opus 4.8 發布,成為最新公開旗艦模型
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TestingCatalog