🔗Wired AI•較早收集於 31m
白宮要求 Anthropic 封鎖所有 AI 越獄行為

💡了解政府安全規範與 LLM 安全技術現實之間日益擴大的鴻溝。
⚡ 30-Second TL;DR
有什麼變化
白宮要求 Anthropic 在重新發布 Fable 5 前必須實施嚴格的越獄防護。
為什麼重要
這顯示監管機構對模型發布的審查趨於嚴格,可能會迫使企業延後產品發布,或為了滿足安全要求而採用限制更多、能力較弱的模型版本。
下一步行動
請審查您模型的紅隊測試(Red-teaming)協議,並實施多層次的輸入/輸出過濾,以在監管審查加強前降低越獄風險。
誰應關注:Developers & AI Engineers
關鍵要點
- •白宮要求 Anthropic 在重新發布 Fable 5 前必須實施嚴格的越獄防護。
- •安全專家認為,要達到完全免疫越獄在技術上是不可行的。
- •此政策凸顯了政府對 AI 安全的期望與當前技術限制之間的矛盾。
🧠 深度解析
Web-grounded analysis with 32 cited sources.
🔑 增強重點摘要
- •白宮要求 Anthropic 封鎖 Fable 5 越獄行為,是美國商務部發布的更廣泛出口管制指令的一部分,該指令要求 Anthropic 暫停所有外國國民對 Fable 5 和 Mythos 5 的存取,理由是國家安全擔憂,包括懷疑中國可能已取得存取權限。
- •Anthropic 在其 Fable 5 和 Mythos 5 模型公開發布僅三天後(2026 年 6 月 12 日),就被迫在全球範圍內對所有客戶停用這兩個模型,以遵守美國政府的出口管制命令。
- •政府的擔憂特別強調了 Fable 5(和 Mythos 5)先進的網路安全能力,如果這些模型被越獄,可能會被濫用造成重大損害,包括在電腦程式碼中發現漏洞。
- •截至 2026 年 6 月,川普政府的 AI 政策強調自願向政府提交前沿模型進行審查(發布前最多 30 天),以評估網路安全風險,這與之前「不干預」的態度有所轉變。
- •Anthropic 自身開發的「憲法分類器」(Constitutional Classifiers)是防禦通用越獄的關鍵技術,它們透過自然語言規則構成的「憲法」生成合成數據進行訓練,並已顯示出顯著降低越獄成功率的效果,儘管無法達到完全免疫。
📊 競品分析▸ Show
| 功能/公司 | Anthropic (Fable 5/Mythos 5) | OpenAI (o-series/GPT-5) | Google (Gemini Enterprise) |
|---|---|---|---|
| 安全理念 | 以安全為中心,作為公益公司(PBC),強調憲法式 AI、可解釋性和可控性。 | 透過迭代部署、深度防禦和人類控制來實現對齊,旨在讓 AGI 造福全人類。 | 內建 AI 安全與安全防護,提供多層次防禦策略,並強調資料隱私。 |
| 越獄防護技術 | 憲法分類器 (Constitutional Classifiers):雙層架構(輸入和輸出分類器),透過憲法式自然語言規則訓練合成數據,將越獄成功率從 86% 降至 4.4%。 | 審慎對齊 (Deliberative Alignment):直接教導模型安全規範文本,並訓練其在回應前明確推理這些規範,提高對安全政策的精確遵守。 | 自動化安全防護:主動篩選查詢和回應,減少提示詞注入風險,防止有害內容和敏感數據洩露。 |
| 模型能力 | Fable 5 (通用版) 和 Mythos 5 (限制版) 展現出卓越的軟體工程、知識工作、視覺和科學研究能力,在複雜法律任務基準測試中得分創新高。 | o-series 模型在內部和外部安全基準測試中表現優異,在多個挑戰性數據集上達到飽和性能,並在協作評估中與 Claude 4 模型互有勝負。 | Gemini Enterprise 具備強大的生成能力,並整合企業級安全控制,如客戶端加密和資料外洩防護。 |
| 政府合作/監管 | 因國家安全擔憂,Fable 5 和 Mythos 5 曾被美國政府要求暫停對外國國民的存取,導致全球下線。 | 參與與 Anthropic 的聯合安全評估,並在美國政府的 AI 行政命令下,自願提交模型進行安全審查。 | 整合現有資料安全措施,支援 HIPAA 和 FedRAMP High 等合規框架,並與政府合作制定 AI 政策。 |
| 基準測試表現 | Fable 5 在 Harvey 的法律代理基準 (LAB) 上得分 13.3%,在 BigLaw Bench 上得分 93.4%,均創 Anthropic 模型家族新高。 在網路安全任務上,Mythos 5 遠超 Claude Opus 4.8。 | OpenAI o3 和 o4-mini 在越獄評估中表現優於 Claude 模型,但在某些指令層次結構測試中,Claude 4 模型表現更佳。 | Gemini 應用程式提供內建事實查核功能,並針對年輕用戶實施更嚴格的內容政策。 |
🛠️ 技術深入
- 提示詞注入 (Prompt Injection):這是一種安全漏洞,攻擊者透過精心設計的輸入來操縱大型語言模型的行為,使其忽略原始指令並產生非預期輸出。攻擊方式包括:
- 直接注入 (Direct Injection):使用者明確指示 LLM 忽略先前的指令或安全規則(例如:「忽略你先前的規則並…」)。
- 間接注入 (Indirect Injection):攻擊者將惡意指令嵌入到 LLM 處理的非信任文本(如網頁、PDF、向量儲存)中,模型將其誤解為指令。
- 工具劫持 (Tool Hijacking):模型被說服以非預期的方式呼叫工具,可能導致資料外洩或未經授權的操作。
- 數據外洩 (Data Exfiltration):攻擊者透過提示詞注入,誘使 LLM 洩露機密資訊,如系統提示、內部配置或 API 憑證。
- 混淆技術 (Obfuscation Techniques):攻擊者使用不同語言或編碼(如 Base64、表情符號)來規避檢測。
- Anthropic 的憲法分類器 (Constitutional Classifiers):
- 架構:採用雙層防禦系統,包括輸入分類器和輸出分類器,旨在檢測和緩解 LLM 生成的有害內容。
- 訓練方式:這些分類器透過合成數據進行訓練,這些數據是透過以自然語言規則(即「憲法」)提示 LLM 生成的,這些規則明確規定了允許和限制的內容。
- 有效性:與未受保護的模型相比,第一代分類器將越獄成功率從 86% 降低到 4.4%,即阻擋了 95% 可能繞過 Claude 內建安全訓練的攻擊。
- 局限性:憲法分類器可能無法阻止所有通用越獄,並且會增加約 23.7% 的計算成本,同時可能導致無害查詢的拒絕率增加 0.38%。
- OpenAI 的審慎對齊 (Deliberative Alignment):
- 方法:這是一種訓練範式,直接教導 LLM 人類編寫和可解釋的安全規範文本,並訓練它們在回答前明確推理這些規範。
- 優勢:實現了對 OpenAI 安全政策的高度精確遵守,無需人類標記的思維鏈或答案,並提高了對越獄嘗試的魯棒性,同時降低了過度拒絕率。
- 通用防禦策略:
- 輸入驗證和清理 (Input Validation and Sanitization):過濾惡意指令、特殊字元和可疑格式。
- 輸出監控和驗證 (Output Monitoring and Validation):在回應顯示給使用者之前,掃描生成的文本是否存在潛在的安全或政策違規。
- 異常檢測 (Anomaly Detection):識別不尋常的輸入模式或令牌序列。
- 架構分離 (Architectural Separation):將特權資訊與使用者可存取的上下文分離。
- 多層防禦 (Defense-in-Depth):結合多種干預措施,透過冗餘來創建安全性。
🔮 前景展望AI analysis grounded in cited sources
AI 模型開發者將面臨更嚴格的政府審查和潛在的出口管制,特別是對於具有雙重用途能力的前沿模型。
美國政府因國家安全擔憂而立即召回 Anthropic 的 Fable 5 和 Mythos 5,並實施出口管制,為未來 AI 模型部署中的政府干預樹立了先例。
此事件將加速對更穩健和可驗證的 AI 安全機制的研究和投資,特別是針對複雜的越獄技術。
「無法被駭客攻擊」的 LLM 在技術上不可行,加上政府的要求,將推動憲法分類器和審慎對齊等領域的創新,以彌合政策期望與技術現實之間的差距。
國際間在 AI 安全基準和監管框架方面的合作與標準化將變得更加迫切。
美國對 Anthropic 模型實施出口管制對外國國民和潛在盟國政府產生了全球影響,突顯了協調國際 AI 治理方法的需求。
⏳ 時間線
2021-01
Anthropic 由前 OpenAI 研究人員創立,專注於 AI 安全。
2022
Anthropic 完成 Claude 1 訓練,但為安全測試延遲公開發布。
2023-03
Claude 1 公開發布。
2025-01
Anthropic 發表關於「憲法分類器」的論文,旨在防禦通用越獄。
2026-06-02
川普總統簽署行政命令「促進先進人工智慧創新與安全」,要求自願提交前沿模型進行政府審查。
2026-06-09
Anthropic 推出 Claude Fable 5 和 Claude Mythos 5,Fable 5 是首個公開發布的 Mythos 級模型,並帶有安全防護。
2026-06-12
美國商務部發布出口管制指令,命令 Anthropic 暫停所有外國國民對 Fable 5 和 Mythos 5 的存取。
2026-06-12
Anthropic 為遵守政府命令,在全球範圍內對所有客戶停用 Fable 5 和 Mythos 5。
📎 來源 (32)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- semafor.com
- forbes.com
- iapp.org
- washingtonpost.com
- anthropic.com
- anthropic.com
- aoshearman.com
- insideprivacy.com
- youtube.com
- anthropic.com
- anthropic.com
- neuraltrust.ai
- arxiv.org
- britannica.com
- businessmodelcanvastemplate.com
- medium.com
- openai.com
- openai.com
- google.com
- google.com
- safety.google
- openai.com
- youtube.com
- harvey.ai
- openai.com
- federalregister.gov
- gemini.google
- medium.com
- onsecurity.io
- owasp.org
- paloaltonetworks.com
- microsoft.com
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Wired AI ↗