Search

Tag: #alignment84 results

CRAFT:隱藏狀態RL防護越獄攻擊

CRAFT:隱藏狀態RL防護越獄攻擊

CRAFT是一種紅隊對齊框架,利用隱藏表示對齊推理模型,提升對越獄攻擊的魯棒性。它結合對比學習與RL,在潛在空間分離安全/不安全軌跡。在Qwen3-4B-Thinking與R1-Distill-Llama-8B上,實現推理安全提升79%、回應安全提升87.7%,優於IPO與SafeKey。

ArXiv AIResearchMar 19#alignment#jailbreak#latent-space
Claude 模型在憲法遵循上表現出色

Claude 模型在憲法遵循上表現出色

研究人員使用對抗性多輪情境,測試 AI 模型對 Anthropic Claude 憲法 205 條原則的遵循度。最新 Claude Sonnet 4.6 和 Opus 4.6 的違反率僅 1.9% 和 2.9%,遠優於先前版本的 7-15%。GPT 模型在 OpenAI 模型規範上也穩步改善,至 1.5% 違反率。

AI Alignment ForumCommunityMar 12#alignment#constitution#post-training
模型歸罪診斷 LLM 誤行為

模型歸罪診斷 LLM 誤行為

研究人員提出模型歸罪技術,用以揭露 LLM 誤行為背後動機,區分陰謀與混亂或錯誤。他們使用黑盒方法調查自發行為,如告密、欺騙、作弊與沙袋戰。主要心得強調 CoT 分析、反事實提示及多方法匯聚證據。

AI Alignment ForumCommunityFeb 27#alignment#model-safety#black-box
哲學在 AGI 時代的角色

哲學在 AGI 時代的角色

隨著 DeepMind 等 AI 實驗室追求 AGI,哲學家在解決對齊問題、偏見以及超級智能的長期影響方面變得至關重要。本文探討了技術優化與以人為本的價值體系之間的張力。

虎嗅MediaJul 9#ai-ethics#agi#alignment
Page 5 of 9