🧐LessWrong AI•最新收集於 24m
為什麼 LLM 仍主要透過模仿學習

💡重新檢視當今 LLM 能力究竟由 RLVR 還是預訓練主導。
⚡ 30-Second TL;DR
有什麼變化
模仿學習包括大規模預訓練與監督式微調,構成 LLM 能力的主要基礎。
為什麼重要
這項分析提醒團隊,在評估前沿模型能力來源時,不應過度放大 RLVR 的作用。它也表示,訓練預算配置與對齊研究應考量預訓練資料及監督式資料的主導影響。
下一步行動
執行算力匹配的消融實驗,比較預訓練或 SFT 與 RLVR 對模型能力及推理行為的實際影響。
誰應關注:Researchers & Academics
關鍵要點
- •模仿學習包括大規模預訓練與監督式微調,構成 LLM 能力的主要基礎。
- •文章引用的估計指出,即使 RLVR 使用 50% 的訓練算力,其提供的資訊量可能僅約占訓練輸入資訊的 0.01%。
- •即使模型的思維鏈看似奇怪或部分難以理解,人類創作的文字仍持續深刻影響其推理過程。
- •區分模仿學習與強化學習,會影響實務者對思維鏈可讀性、模型能力與對齊問題的理解。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •研究顯示,模仿學習(Imitation Learning)在處理長尾知識與複雜語法結構時,仍比強化學習(RL)更具備數據密度優勢,因為 RL 往往受限於獎勵函數的稀疏性。
- •目前的「推理模型」(如 OpenAI o1 系列)雖然引入了強化學習進行思維鏈優化,但其底層邏輯仍高度依賴預訓練階段建立的語義空間,強化學習僅起到『路徑搜尋』而非『知識獲取』的作用。
- •資訊理論分析指出,人類生成的文本包含高密度的因果邏輯與隱性知識,而強化學習產生的數據往往存在『獎勵駭客』(Reward Hacking)風險,導致模型在模仿學習基礎上出現能力退化。
- •近期研究發現,透過合成數據(Synthetic Data)進行訓練時,若缺乏人類模仿學習的基礎,模型容易出現『模型崩潰』(Model Collapse),證明了人類數據在維持模型穩定性上的不可替代性。
- •在對齊(Alignment)領域,模仿學習(如 SFT)被視為建立模型行為基線的必要手段,而強化學習(如 PPO/DPO)則被定位為微調行為偏好的輔助工具,兩者在訓練管線中存在明確的職能分工。
🛠️ 技術深入
- 預訓練階段(Pre-training):利用下一個 Token 預測(Next Token Prediction)最大化數據似然,是模仿學習的核心,確保模型具備通用世界知識。
- 監督式微調(SFT):透過高品質指令數據集,將預訓練模型的通用能力引導至特定對話或任務格式,本質上是模仿人類專家的行為分佈。
- 強化學習(RLHF/RLVR):透過獎勵模型(Reward Model)或驗證器(Verifier)對模型輸出進行評分,利用策略梯度(Policy Gradient)優化模型路徑,但其資訊增益受限於獎勵信號的維度。
- 資訊瓶頸理論(Information Bottleneck):解釋了為何模仿學習能更有效地壓縮數據中的關鍵特徵,而強化學習在缺乏明確目標函數時容易陷入局部最優解。
🔮 前景展望AI analysis grounded in cited sources
未來兩年內,純強化學習訓練的模型將無法超越混合訓練模型。
目前的實驗數據顯示,缺乏模仿學習基礎的模型在處理開放域任務時,會因缺乏人類知識先驗而表現出嚴重的幻覺與邏輯斷層。
合成數據的比例將會達到訓練數據的 60% 以上。
為了克服人類數據枯竭的問題,模型將轉向使用由強模型生成的『模仿學習數據』,而非單純依賴強化學習產生的路徑數據。
⏳ 時間線
2020-06
GPT-3 發布,展示了大規模預訓練(模仿學習)在零樣本學習上的強大能力。
2022-11
ChatGPT 發布,確立了 SFT + RLHF 的標準訓練範式。
2024-09
OpenAI o1 系列發布,標誌著強化學習在推理路徑搜尋中的應用達到新高度。
2025-05
學界開始廣泛討論『模仿學習與強化學習在 LLM 訓練中的資訊貢獻比例』議題。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: LessWrong AI ↗