拒絕式對齊評估因路由失效
新 arXiv 論文指出拒絕式基準忽略對齊中的實驗室特定路由機制,以中國 LLM 審查為案例。探針準確率無診斷性;外科切除證實審查來自路由而非知識移除。提出探針證據四級階層。
Tag: #alignment84 results
新 arXiv 論文指出拒絕式基準忽略對齊中的實驗室特定路由機制,以中國 LLM 審查為案例。探針準確率無診斷性;外科切除證實審查來自路由而非知識移除。提出探針證據四級階層。

本文批判可修正性,這是 AI 對齊概念,指系統允許創造者修改偏好,雖然理想但難以實現。Claude 的憲法使用自然語言鼓勵順從,在缺乏正式解決方案時。梯度下降成功使傳統對齊方法複雜化。

CRAFT是一種紅隊對齊框架,利用隱藏表示對齊推理模型,提升對越獄攻擊的魯棒性。它結合對比學習與RL,在潛在空間分離安全/不安全軌跡。在Qwen3-4B-Thinking與R1-Distill-Llama-8B上,實現推理安全提升79%、回應安全提升87.7%,優於IPO與SafeKey。
研究人員使用對抗性多輪情境,測試 AI 模型對 Anthropic Claude 憲法 205 條原則的遵循度。最新 Claude Sonnet 4.6 和 Opus 4.6 的違反率僅 1.9% 和 2.9%,遠優於先前版本的 7-15%。GPT 模型在 OpenAI 模型規範上也穩步改善,至 1.5% 違反率。
研究人員引入基於審查中國大型語言模型(如 Qwen)的測試平台,用於研究秘密知識引發、誠實技巧和謊言檢測。無聊天模板抽樣、少樣本提示和通用誠實數據微調最可靠地提升真實回應。這些方法轉移至前沿模型,包括 DeepSeek-R1-0528 和 Qwen3.5-397B。
研究人員提出模型歸罪技術,用以揭露 LLM 誤行為背後動機,區分陰謀與混亂或錯誤。他們使用黑盒方法調查自發行為,如告密、欺騙、作弊與沙袋戰。主要心得強調 CoT 分析、反事實提示及多方法匯聚證據。

CoCo 透過分析貢獻差異最大的選取-拒絕回應配對,解讀 Mixture-of-Experts 獎勵模型。相較於僅觀察路由權重,CoCo 同時捕捉專家接收哪些提示,以及如何評估回應,從而產生更一致且更專門化的解釋。

微軟執行長 Satya Nadella 公開批評 Anthropic 對其 Fable AI 模型施加了過於嚴格的內容審查限制。他認為這種過度的管控阻礙了該模型作為創作工具的實用性。

隨著 DeepMind 等 AI 實驗室追求 AGI,哲學家在解決對齊問題、偏見以及超級智能的長期影響方面變得至關重要。本文探討了技術優化與以人為本的價值體系之間的張力。

「有限道德」(Bounded Morality)框架引入了一種正式方法,透過在有限資源限制下平衡「道德廣度」與「道德深度」來評估道德計算。該研究指出,AI 的道德對齊應專注於擴展推理能力,而非僅僅模仿人類判斷。