⚛️較早收集於 11m

Anthropic 限制 Fable 5 討論敏感主題

Anthropic 限制 Fable 5 討論敏感主題
PostLinkedIn
⚛️閱讀原文: Ars Technica AI

💡了解 Fable 5 的新安全邊界,以及它們如何可能影響您現有的 AI 工作流程。

⚡ 30-Second TL;DR

有什麼變化

Fable 5 模型現已封鎖與網路安全相關的查詢

為什麼重要

此更新為前沿模型如何處理高風險領域樹立了先例,可能會影響依賴這些模型進行專業任務的研究人員。這迫使開發者必須尋找其他限制較少的模型來進行敏感領域的研究。

下一步行動

檢視您目前應用程式對 Fable 5 在特定領域任務上的依賴,並針對受限主題實施備援模型。

誰應關注:Developers & AI Engineers

關鍵要點

  • Fable 5 模型現已封鎖與網路安全相關的查詢
  • 生物學與化學主題因安全考量受到限制
  • 反映 Anthropic 對前沿模型安全協議的承諾

🧠 深度解析

Web-grounded analysis with 16 cited sources.

🔑 增強重點摘要

  • Anthropic 的 Fable 5 模型屬於「Mythos 級別」,其敏感查詢(如網路安全、生物學和化學)會自動轉發至功能次之的 Claude Opus 4.8 模型,以確保安全。
  • Fable 5 的限制源於其「Mythos 級別」模型在網路安全領域的強大能力,該模型曾展現出前所未有的能力,能自主發現主要作業系統和網路瀏覽器中的零日漏洞,這可能被濫用於網路攻擊或生物武器開發。
  • Anthropic 對 Fable 5 和 Mythos 5 的流量實施了 30 天的資料保留政策,用於安全監控,即使對於先前簽訂零保留協議的企業客戶也適用。
  • Anthropic 同步推出了 Claude Mythos 5,其底層模型與 Fable 5 相同,但針對經批准的用戶(最初透過與美國政府合作的 Project Glasswing 計畫,面向網路防禦者和關鍵軟體基礎設施提供商)解除了部分安全防護措施。
  • Fable 5 的安全防護措施經過保守調整,平均而言,在不到 5% 的會話中可能會錯誤地觸發,導致無害請求也被轉發至 Opus 4.8。

🛠️ 技術深入

  • Anthropic 的核心安全方法是「憲法式AI」(Constitutional AI, CAI),它透過一套自然語言原則或「憲法」來指導 AI 系統的行為和自我改進,而無需完全依賴人類回饋來確保無害性。
  • CAI 訓練過程包含兩個階段:監督式學習階段(AI 根據原則批判並修改自己的回應)和強化學習階段(AI 根據原則從自身回饋中學習,也稱為來自 AI 回饋的強化學習,RLAIF)。
  • Fable 5 採用了一套新的「分類器」——獨立的 AI 系統——用於檢測潛在的濫用行為,包括越獄嘗試,並阻止主模型回應。當檢測到此類請求時,會將查詢路由至 Claude Opus 4.8。
  • Anthropic 已發布了兩版憲法式AI原則:原始版本於 2023 年發布,而 2026 年 1 月發布的更新版本則從「規則」轉向「智慧」,旨在讓模型能夠泛化廣泛原則而非機械地遵循特定規則。
  • Mythos 級別模型(Fable 5 和 Mythos 5)在網路安全領域展現出先進能力,包括自主發現和利用主要作業系統和網路瀏覽器中零日漏洞的能力。
  • 在 ExploitBench 基準測試中,Mythos 5 的得分為 78.0%,而 Claude Opus 4.8 為 40.0%,GPT-5.5 則為 34.0%。

🔮 前景展望AI analysis grounded in cited sources

AI 公司將面臨更大的壓力來實施強大的安全護欄和透明的風險緩解策略。
隨著像 Fable 5 這樣的前沿模型能力不斷增強,其雙用途風險也隨之增加,促使監管機構和公眾對 AI 安全協議提出更高要求。
針對高風險 AI 能力的「受信任存取計畫」將成為行業常態。
Anthropic 為 Mythos 5 設立的 Project Glasswing 計畫,允許經審查的網路防禦者和生物研究人員存取更強大的模型,這為其他 AI 公司處理高風險能力設定了先例。
AI 模型安全評估和基準測試的標準將會更加嚴格和公開。
Fable 5 的發布伴隨著詳細的安全評估和對其防護措施的測試,這將推動整個行業對模型安全性和潛在濫用風險進行更透明和可驗證的評估。

時間線

2021
Anthropic 成立,由前 OpenAI 研究人員創立,專注於 AI 安全。
2022-12
Anthropic 發表論文《憲法式AI:來自AI回饋的無害性》,介紹了憲法式AI訓練方法。
2023-03
Anthropic 推出 Claude 1,首次公開提供 Claude 模型。
2023-10
Anthropic 發表《集體憲法式AI:以公眾意見校準語言模型》,探索民主程序對AI開發的影響。
2026-01
Anthropic 發布了其憲法式AI原則的重大更新版本,從「規則」轉向「智慧」。
2026-04
Anthropic 宣布其 Mythos 模型,因其強大的網路安全能力而最初限制公開發布,並啟動 Project Glasswing 計畫。
2026-05
Claude Opus 4.8 發布,是當時最新的 Claude 主要模型。
2026-06-09
Anthropic 推出 Claude Fable 5 和 Claude Mythos 5。Fable 5 普遍可用,但對敏感主題設有防護措施;Mythos 5 則對經批准的用戶開放。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Ars Technica AI