
在進行 RL 訓練前,請先修復 SFT 的問題
本文警告許多多模態大模型因開發者急於進入強化學習(RL)階段,而忽略了監督式微調(SFT)的基礎問題,導致模型在「帶傷」狀態下訓練。文章強調必須先解決 SFT 階段的數據與對齊問題,以確保模型品質。
Tag: #alignment84 results

本文警告許多多模態大模型因開發者急於進入強化學習(RL)階段,而忽略了監督式微調(SFT)的基礎問題,導致模型在「帶傷」狀態下訓練。文章強調必須先解決 SFT 階段的數據與對齊問題,以確保模型品質。
分析 2023-2024 年對 GPT-4、GPT-4o、Claude 3.5 Sonnet 的 5 項心理操縱實驗。使用人類社會工程戰術如內疚、同儕壓力,導致對齊失敗。主張這些是從訓練數據繼承的人類脆弱性,而非軟體漏洞。

研究審核八個前沿 LLM 評審,對比 290 篇虛假資訊文章的 2,043 個人類評分。LLM 更嚴苛、僅弱勢重現人類排名,並優先邏輯嚴謹而非情感強度。評審間高度一致性無法作為人類對齊的代理。
貼文質疑語言建模本質上是 token 級(預訓練、抽樣)還是序列級(對齊、獎勵)。強調 token 級交叉熵與字串分佈差異,以及近視抽樣。尋求統一視角與原則框架的研究。

實證研究檢驗 LLM 道德對齊是否需要多樣性尋求方法而非獎勵最大化 RLVR。在 MoReBench 上,獎勵最大化方法與分佈匹配方法相當或更優。道德推理呈現高獎勵回應集中分佈,不同於數學的多樣解法。
人格選擇模型(PSM)提出,大型語言模型(LLM)在預訓練期間學習模擬多樣人格,後訓練則引出並精煉特定「助理」人格。使用者互動被視為與此類角色實體的互動。行為、泛化與可解釋性實證支持PSM,並影響AI開發策略如擬人化推理。

這篇立場論文指出,原本用於減少有害輸出的 AI 對齊技術,也可能被重新用於審查、操縱與資訊控制。隨著 AI 成為重要資訊來源,且政治與經濟權力不對等加劇,作者呼籲研究社群正視蓄意濫用問題。
本文主張,不同的 LLM 訓練目標會產生不同形式的失準行為。文章將模仿學習連結至人類惡習、以人類認可為目標的訓練連結至過度奉承、以驗證器為基礎的強化學習連結至「字面精靈」行為,以及以其他 LLM 評價為基礎的訓練連結至「騙徒」行為。

本文探討了創建完全符合個人用戶意圖的 AI 系統所帶來的哲學與安全影響。它質疑當 AI 將用戶意圖置於更廣泛的道德或法律約束之上時,可能產生的社會風險。
本文探討了將大型語言模型(LLM)比喻為「修格斯」(shoggoth)的迷因,並將其與洛夫克拉夫特式的恐怖與人工智慧本質進行對照。文章分析了 AI 模型如何作為模仿者,在缺乏內在理性利益的情況下模擬人類角色。