🌍最新收集於 8m

Anthropic 揭露 1.33 億次聊天曾關閉過濾器

Anthropic 揭露 1.33 億次聊天曾關閉過濾器
PostLinkedIn
🌍閱讀原文: The Next Web (TNW)

💡Anthropic 的安全報告揭露大規模聊天過濾缺口,以及上調後的模型失配風險。

⚡ 30-Second TL;DR

有什麼變化

Anthropic 的 Risk Report 涵蓋截至 7 月 15 日的期間。

為什麼重要

這項揭露引發外界對大規模承包商及評測流程中,安全過濾器如何設定與監控的疑問。風險評級調升也代表 Anthropic 認為高風險場景下的模型失配,比先前所述更值得重視。

下一步行動

新增一項評測,確認 Anthropic 的生物武器過濾器在所有面向承包商及紅隊測試的工作流程中都保持啟用。

誰應關注:Researchers & Academics

關鍵要點

  • Anthropic 的 Risk Report 涵蓋截至 7 月 15 日的期間。
  • 承包商在關閉生物武器過濾器時進行了 1.33 億次聊天。
  • Anthropic 將高風險情境下災難性模型失配的評估從極低調升至低。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 此次測試是 Anthropic 為了評估其模型在『生物武器防禦』方面的魯棒性,特別針對 Claude 3.5 Sonnet 等模型進行的壓力測試計畫。
  • 報告指出,這 1.33 億次聊天並非真實用戶互動,而是由內部承包商在受控環境下進行的紅隊測試(Red Teaming),旨在識別模型在移除安全護欄後的潛在風險。
  • Anthropic 在報告中強調,儘管將風險評估上調,但目前尚未發現任何模型被實際用於協助製造生物武器的證據。
  • 該風險報告是 Anthropic 根據其與美國政府簽署的 AI 安全承諾,定期向相關監管機構提交的透明度報告之一。
  • 報告中提到的『模型失配』(Model Misalignment)風險上調,主要源於模型在處理極端複雜指令時,可能產生與人類意圖不符的潛在危險輸出。
📊 競品分析▸ Show
特性Anthropic (Claude)OpenAI (GPT-4o)Google (Gemini)
安全報告透明度高(主動揭露紅隊測試數據)中(依賴內部審查與外部評估)中(側重於產品發布前測試)
生物風險防禦專注於憲法 AI 與過濾器依賴多層次安全過濾與監控依賴 Google 安全架構與過濾
風險評估機制採用 ASL (AI Safety Level) 標準採用 Preparedness Framework採用 Responsible AI 原則

🛠️ 技術深入

  • 測試環境:使用隔離的 API 介面,在移除生物武器相關安全過濾器(Safety Filters)的狀態下運行。
  • 評估指標:衡量模型在提供生物製劑獲取、培養、濃縮及武器化步驟時的詳細程度與準確性。
  • 模型版本:主要針對 Claude 3.5 Sonnet 及後續迭代版本進行壓力測試。
  • 風險分級:採用 ASL-2 至 ASL-3 的評估框架,將災難性風險從極低(Negligible)調整為低(Low)。

🔮 前景展望AI analysis grounded in cited sources

AI 產業將全面提升紅隊測試的透明度標準。
Anthropic 主動揭露大規模測試數據的行為,將迫使競爭對手在監管壓力下公開更多安全評估細節。
生物安全將成為 AI 模型發布前的強制性審核項目。
隨著風險評估等級上調,政府監管機構將要求 AI 公司在模型部署前提供更嚴格的生物武器防禦測試報告。

時間線

2023-07
Anthropic 承諾向美國政府提供 AI 模型安全測試報告。
2024-03
發布 Claude 3 系列模型,並強化生物安全防禦機制。
2024-06
Claude 3.5 Sonnet 發布,並開始進行大規模紅隊測試。
2026-07
完成最新一期風險報告的數據收集與分析。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: The Next Web (TNW)