⚛️量子位•較早收集於 48m
在進行 RL 訓練前,請先修復 SFT 的問題

💡在開始 RL 訓練前先修復 SFT 流程,避免將算力浪費在有缺陷的模型上。
⚡ 30-Second TL;DR
有什麼變化
SFT 階段的缺陷往往會延續到 RL 訓練中
為什麼重要
忽略 SFT 品質的開發者,在昂貴的 RL 階段將面臨模型效能下降與對齊問題。提早解決這些問題可節省算力成本並提升模型的最終穩健性。
下一步行動
在啟動任何 RLHF 或 DPO 訓練流程之前,請先審核您的 SFT 數據集,確保其品質與對齊的一致性。
誰應關注:Researchers & Academics
關鍵要點
- •SFT 階段的缺陷往往會延續到 RL 訓練中
- •多模態模型需要嚴格的 SFT 數據清理
- •在應用 RLHF 之前,應優先處理基礎對齊工作
🧠 深度解析
Web-grounded analysis with 19 cited sources.
🔑 增強重點摘要
- •監督式微調(SFT)的有效性高度依賴於訓練數據的品質、多樣性和準確性,其中數據品質的重要性往往超越數量,例如Meta的LIMA研究表明,僅需1,000個精心策劃的範例即可達到接近GPT-4的SFT品質。
- •單純依賴SFT可能導致模型「脆弱性」(brittleness),使其容易受到對抗性攻擊或「越獄」提示的影響,因為模型可能只學習了表面層次的相關性,而非深層次的原理或隱含知識。
- •SFT在多模態模型中可能引入「分佈漂移」(distributional drift),導致感知錯誤和推理失敗在後續的強化學習(RL)階段中複合,因此需要額外的分佈對齊階段來緩解此問題。
- •高SFT分數並不總是能可靠地預測RL訓練後的性能提升;在某些情況下,對具有改進SFT性能的模型進行RL訓練,其結果可能比直接在未經SFT的基礎模型上進行RL訓練更差,特別是當SFT數據存在偏差或過於同質時。
- •SFT在處理複雜的對齊目標、模糊情境和動態權衡方面存在局限性,這些挑戰通常需要透過人類回饋強化學習(RLHF)等更進階的方法來解決。
🛠️ 技術深入
- SFT是將預訓練模型轉化為指令遵循助手的關鍵第一步,其核心機制是透過精心策劃的指令-回應對來調整模型的行為。
- SFT的技術考量包括學習率選擇、批次大小、序列長度、防止預訓練知識的災難性遺忘,以及監控過度擬合。
- 為了提高SFT效率,特別是在資源受限的情況下,常使用參數高效微調(PEFT)方法,如LoRA(Low-Rank Adaptation)和QLoRA(Quantized LoRA),其中QLoRA將基礎模型量化為4位元精度。
- SFT數據的格式化通常涉及將提示和回應串聯成單一序列,並使用特殊標記(例如
<s>[INST] 提示文本 [/INST] 回應文本 </s>)來區分輸入的不同部分,這些標記取決於所使用的基礎模型。 - RLHF通常包含三個階段:首先進行SFT以建立基礎能力,然後訓練一個基於人類偏好排名的獎勵模型,最後使用強化學習演算法(如近端策略優化PPO)來優化語言模型以最大化獎勵模型的得分。
- 新興的SFT改進方法,如動態微調(Dynamic Fine-Tuning, DFT),透過動態調整目標函數中每個token的機率來穩定梯度更新,以改善SFT的泛化能力。
- 針對大型多模態模型,SFT可能導致異質性的分佈漂移(例如視覺基礎錯誤和推理失敗),為此,PRISM等方法在SFT和RLVR之間引入了明確的分佈對齊階段,並使用專門的感知和推理專家組成的混合專家(Mixture-of-Experts, MoE)判別器來提供糾正信號。
🔮 前景展望AI analysis grounded in cited sources
未來大型模型開發將更著重於SFT數據的質量而非數量。
研究顯示,精心策劃的少量數據在SFT中能帶來優於大量嘈雜數據的性能,促使開發者投入更多資源於數據策劃。
多模態模型將整合更複雜的預對齊階段以解決SFT引起的漂移問題。
由於SFT在多模態推理中會導致感知和推理錯誤的複合性漂移,新的方法如PRISM已提出在SFT和RLVR之間加入明確的分佈對齊階段。
SFT的評估指標將超越傳統分數,更側重於泛化能力和RL結果的預測性。
有研究挑戰了高SFT分數與RL後性能提升的相關性,並提出泛化損失和Pass@large k等替代指標能更可靠地預測RL結果。
⏳ 時間線
2020-2022
RLHF技術由OpenAI和Anthropic開創,成為ChatGPT等產品的關鍵創新,將AI從研究轉變為消費產品。
2022-04
OpenAI發表關於使用RLHF訓練InstructGPT(ChatGPT前身)的論文,展示其在語言模型對齊上的應用。
2023-05
業界開始廣泛討論SFT與RLHF的協同作用,強調SFT作為RLHF訓練流程中基礎且關鍵的第一步。
2023-11
Meta的LIMA論文展示僅用1,000個精心策劃的指令-回應對即可達到接近GPT-4的SFT質量,突顯SFT數據質量的重要性。
2025-08
提出Dynamic Fine-Tuning (DFT) 等SFT改進方法,旨在解決SFT在泛化能力上的限制。
2026-05
針對大型多模態模型,提出PRISM等新管道,以緩解SFT引入的分佈漂移問題,並在SFT與RLVR之間加入明確的對齊階段。
📎 來源 (19)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
- Google Search Source
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 量子位 ↗