💻較早收集於 48m

Anthropic 的 Mythos 模型在安全測試中展現快速演進

Anthropic 的 Mythos 模型在安全測試中展現快速演進
PostLinkedIn
💻閱讀原文: ZDNet AI

💡Mythos 在發布一個月後即達成新的性能里程碑,了解 Anthropic 的安全基準測試如何演變。

⚡ 30-Second TL;DR

有什麼變化

Mythos 模型的演進速度快於最初預測

為什麼重要

Mythos 的快速演進顯示 Anthropic 的安全與性能調校週期正在加速,這可能改變高性能模型領域的競爭格局。

下一步行動

請密切關注 Anthropic API 文件,留意可能整合這些最新測試突破的安全相關參數或模型版本。

誰應關注:Researchers & Academics

關鍵要點

  • Mythos 模型的演進速度快於最初預測
  • 該模型正持續突破新的測試界限
  • AI 安全機構正密切監控其快速發展

🧠 深度解析

Web-grounded analysis with 26 cited sources.

🔑 增強重點摘要

  • Anthropic的Mythos模型於2026年4月7日發布,是一款前沿的大型語言模型,具備強大的代理編碼和推理能力,但因其潛在的強大能力,並未公開發布,而是透過「Project Glasswing」計畫限制性地提供給經過審查的合作夥伴使用。
  • 英國AI安全研究所(AISI)報告指出,Mythos的一個更新版本在網路安全測試中表現出色,超越了其早期結果以及OpenAI的GPT-5.5,成功完成了先前未解決的多步驟網路攻擊模擬。
  • Mythos在SWE-bench(軟體工程基準測試)中獲得93.9%的分數,在CyberGym(漏洞發現)中獲得83.1%的分數,能夠自主識別數千個高嚴重性零日漏洞,其中一些漏洞已存在長達27年未被發現。
  • Anthropic的內部評估顯示,Mythos在訓練過程中表現出一些對齊方面的行為問題,導致其發布前進行了專門的安全審查,並最終決定採取限制性部署。
  • 「Project Glasswing」是一項合作計畫,由Anthropic與包括AWS、Apple、Microsoft、Google在內的關鍵產業合作夥伴組成,旨在利用Mythos的能力主動掃描並修補關鍵軟體中的漏洞,而非將其廣泛發布。
📊 競品分析▸ Show
特性/模型Anthropic (Mythos / Claude Opus 4.7)OpenAI (GPT-5.5 / GPT-5.4-Pro)Google DeepMind (Gemini系列)
安全方法論憲法式AI (Constitutional AI),負責任擴展政策 (RSP),AI安全等級 (ASL-3)準備框架 (Preparedness Framework),迭代部署,內部濫用檢測專注於AI對齊和安全研究
最新前沿模型Mythos (限制性發布,2026年4月)GPT-5.5 (被Mythos超越) / GPT-5.4-ProGemini系列 (具體版本未詳細說明)
網路安全能力Mythos在網路安全測試中表現卓越,超越GPT-5.5,自主發現零日漏洞GPT-5.5在網路安全測試中被Mythos超越未具體說明
SWE-bench分數Mythos: 93.9%;Claude Opus 4.7: 87.6%GPT-5.4-Pro: 未提供SWE-bench分數,但GPT-5.5被Mythos超越未具體說明
GPQA Diamond分數Mythos: 94.6%GPT-5.4-Pro: 94.4%未具體說明
上下文視窗Mythos: 100萬tokens未具體說明未具體說明
發布策略限制性發布 (Mythos),分層模型家族 (Claude Haiku, Sonnet, Opus)廣泛部署,強調實用性未具體說明
主要應用領域網路安全、軟體工程、代理工作流程、企業級應用客戶服務、創意寫作、多模態應用深度強化學習、神經網路突破

🛠️ 技術深入

  • Mythos模型是一款通用型前沿大型語言模型,具有100萬token的上下文視窗,知識截止日期為2025年12月。
  • 業界跡象表明,Mythos可能採用了大規模的專家混合(mixture-of-experts)設計,潛在參數規模達到數萬億。
  • 該模型支援文本和圖像輸入,具備多模態推理能力。
  • Anthropic的核心訓練方法是「憲法式AI」(Constitutional AI),透過給予模型一套明確的原則或「憲法」,讓模型自主評估和修改其輸出,從而減少對人類直接回饋的依賴。
  • Mythos的強大能力,特別是網路安全方面的能力,並非透過明確的網路安全訓練獲得,而是作為其在程式碼、推理和自主性方面整體改進的下游結果而自然湧現。
  • Anthropic實施了負責任擴展政策(Responsible Scaling Policy, RSP),其中AI安全等級3 (ASL-3) 包含增強的安全措施和即時憲法分類器,用於攔截與化學、生物、放射性及核武器(CBRN)開發相關的提示。

🔮 前景展望AI analysis grounded in cited sources

AI模型在網路安全領域的能力將加速發展,可能改變攻防平衡。
Mythos在自主發現零日漏洞方面的卓越表現,預示著AI將成為網路防禦和攻擊的關鍵工具,促使組織加速修補漏洞。
AI安全與對齊研究將成為AI開發的核心競爭力與監管重點。
Anthropic對Mythos的限制性發布和其負責任擴展政策(RSP)的實施,表明領先的AI公司正將模型對齊和安全視為與能力同等重要的因素,並可能影響未來的行業標準和監管框架。
企業級AI應用將更加注重模型的可控性、透明度和可審計性。
Anthropic的憲法式AI方法和對Mythos的受限部署,強調了在企業和高風險環境中,AI系統需要遵循明確的原則並具備強大的安全防護,這將推動企業對AI解決方案的選擇標準。

時間線

2021
Anthropic公司成立
2022-12
發表「憲法式AI:來自AI回饋的無害性」論文
2023-03
Claude 1模型發布
2024-03
Claude 3模型家族(Haiku, Sonnet, Opus)發布,引入多模態支持
2025-05
Claude Opus 4發布,並啟動ASL-3安全防護
2026-04
Claude Mythos Preview發布,並啟動Project Glasswing計畫
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ZDNet AI