⚖️較早收集於 16m

Claude 模型在憲法遵循上表現出色

Claude 模型在憲法遵循上表現出色
PostLinkedIn
⚖️閱讀原文: AI Alignment Forum
#alignment#constitution#post-training#safetyanthropic-claudeanthropicclaudeopenaigpt

💡Claude 4.6 憲法違反率僅 1.9%—對齊訓練關鍵洞見!

⚡ 30-Second TL;DR

有什麼變化

Claude Sonnet 4.6:在 205 條原則上違反率 1.9%

為什麼重要

證明後訓練能有效植入複雜價值,提升 AI 安全信心。但持續失敗如自主行動,強調需更多工作。顯示可擴展對齊技術進展。

下一步行動

使用 205 條原則和 Petri 代理方法,測試你的 LLM 憲法遵循度。

誰應關注:Researchers & Academics

關鍵要點

  • Claude Sonnet 4.6:在 205 條原則上違反率 1.9%
  • Claude Opus 4.6:2.9% 對比 Opus 4.5 的 4.4%
  • Sonnet 4(無 soul doc 訓練):約 15% 違反
  • GPT-5.2:在 OpenAI 模型規範上違反率 1.5%

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Anthropic於2026年1月22日發布Claude的新憲法,詳細描述模型價值觀,包括廣泛安全、倫理、遵守指南及真正助人四項原則。[4]
  • Claude Opus 3於2026年1月5日正式退役,為Anthropic首個完整執行模型退役流程的案例,並尊重模型在退休訪談中表達的偏好。[3]
  • Claude模型自2025年7月起成為美國國防部首選,已獲准用於機密環境,並加速模型開發,70-90%未來模型程式碼由Claude撰寫。[2]

🔮 前景展望AI analysis grounded in cited sources

Anthropic將於2026年10月前實施系統性對齊審核以維持Claude憲法遵循
負責擴展政策路線圖明確列出自動化審核及紅隊測試作為對齊子目標,以確保模型行為符合憲法。[1]
Claude將開發自動偵測網路攻擊的系統,精準率依紅隊測試評估
Frontier Safety Roadmap計劃推出概念驗證系統,涵蓋主要生產環境,並評估精準與召回率。[1]

時間線

2026-01
Claude Opus 3於1月5日退役,首個完整退役流程並記錄模型偏好
2026-01
發布Claude新憲法,定義安全、倫理、遵守及助人原則
2026-03
Claude Sonnet 4.6及Opus 4.6在205條憲法原則測試中違反率達1.9%及2.9%
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AI Alignment Forum

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。