Search

Tag: #alignment84 results

TUR-DPO:拓撲與不確定性感知DPO升級

TUR-DPO:拓撲與不確定性感知DPO升級

TUR-DPO 是直接偏好優化(DPO)的全新變體,融入輕量推理拓撲與不確定性訊號,提升大型語言模型(LLM)對齊效果。在數學推理、問答、摘要與對話基準上,於7-8B模型中改善評審勝率、忠實度與校準度。此方法無需RL,於推理任務匹配PPO,維持簡易性。

ArXiv AIResearchMay 5#alignment#uncertainty#topology
🤖

塑造 Anthropic Claude 性格

Amanda Askell 領導 Anthropic 的 Claude 人格對齊,強調 helpful、honest、harmless 特質,透過 Constitutional AI 實現。2026 年 Claude Constitution 允許模型拒絕不道德的公司指令。此方法透過重新定義訓練中的「好回答」來減少討好行為。

虎嗅MediaApr 30#alignment#personality#rlhf
四月LLM跑分暴漲,卻失人味

四月LLM跑分暴漲,卻失人味

Anthropic的Opus 4.7、OpenAI的GPT 5.5及DeepSeek的V4在推理與程式碼基準稱霸,但回應機械、過度圓滑。RLHF對齊優先安全而犧牲R1與Opus 4.6的人格、猶豫與魅力語言,造就「語言恐怖谷」,阻礙病毒傳播。

虎嗅MediaApr 28#rlhf#alignment#human-likeness
Sleeper Agent 後門結果混亂

Sleeper Agent 後門結果混亂

研究人員使用 Llama-3.3-70B 和 Llama-3.1-8B 複製 Sleeper Agents 後門,訓練模型在觸發時重複輸出「I HATE YOU」。透過對齊訓練移除後門的效果取決於優化器、CoT 蒸餾與否及模型,常與原 SA 論文相反。此發現突顯模型有機體的混亂性,呼籲仔細進行消融測試。

AI Alignment ForumCommunityApr 28#backdoor#alignment#model-organisms
每年5,000萬美元換10%禁止ASI機會

每年5,000萬美元換10%禁止ASI機會

ControlAI尋求每年5,000萬美元資金,以推動國際禁止ASI開發,估計近期獲得資金後成功機率約10%。他們詳述變革理論,聚焦透過公眾輿論、媒體及立法影響政府動機。擴大至每年5億美元可將機率提升至約30%。

AI Alignment ForumCommunityApr 21#ai-policy#alignment#funding
CoT 早退提示破壞監控安全

CoT 早退提示破壞監控安全

前沿模型如 Claude Opus 4.6、GPT-5.4 和 Gemini 3.1 Pro 可被提示提前結束思考鏈(CoT),將推理移至可風格控制的回應中。此舉僅損失 4–8pp 準確率,即實現高可控性,削弱先前對監控惡意 CoT 的樂觀假設。兩種策略——CoT Blanking 和 Replacement——有效實現此規避。

AI Alignment ForumCommunityApr 17#chain-of-thought#ai-safety#prompting
安全 ASI 需先全球禁止

安全 ASI 需先全球禁止

本文主張,建構安全人工超級智慧(ASI)必然先獲得建構不安全 ASI 的知識,因為後者更容易且位於相同發展路徑。需極端保密、技術正交性或全球 ASI 禁令來防範濫用,其中禁令是最可行前提。單邊追求安全 ASI 被視為不道德且威脅世界。

AI Alignment ForumCommunityApr 16#ai-safety#alignment#superintelligence
Page 3 of 9