🤖最新收集於 51m

GRPO 擴展帶來出乎意料的不均衡結果

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡相同 GRPO 設定下,中型模型退化最嚴重,揭示模型規模無法單獨預測後訓練表現。

⚡ 30-Second TL;DR

有什麼變化

從 SFT 到 GRPO 後,WikiText 困惑度在 V1、V2、V3 分別惡化 0.2%、52% 與 5%。

為什麼重要

結果顯示,GRPO 後訓練品質可能更取決於政策格式、獎勵設計與最佳化穩定性,而不只是參數量。實務團隊不應假設模型成功學會獎勵目標,就代表能廣泛轉移推理能力。

下一步行動

在將此配方擴展至生產模型前,請使用一致的 chat template、明確的停止或長度懲罰,並進行 KL 係數掃描來重跑 GRPO 比較。

誰應關注:Researchers & Academics

關鍵要點

  • 從 SFT 到 GRPO 後,WikiText 困惑度在 V1、V2、V3 分別惡化 0.2%、52% 與 5%。
  • 316M 的 V2 模型退化最嚴重,挑戰了模型越大就一定更脆弱或更穩健的假設。
  • V3 掌握了五個算術課程階段中的四個,但 GSM8K 表現仍接近零。
  • 這項實驗受到模型架構、資料混合、Token 數量、格式差異,以及缺乏停止獎勵等因素干擾。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • GRPO(Group Relative Policy Optimization)作為 DeepSeek-R1 核心演算法,其效能高度依賴於獎勵模型(Reward Model)的穩定性,而非僅僅是強化學習的迭代次數。
  • 研究顯示在小參數模型(<1B)中,GRPO 的優化目標容易與 SFT(監督式微調)階段學到的語言建模能力產生衝突,導致災難性遺忘。
  • 該實驗中觀察到的不均衡現象,可能與 GRPO 缺乏價值函數(Value Function)作為基準線有關,導致策略更新在不同模型規模下產生高方差。
  • GSM8K 遷移失敗的根本原因,被推測為模型在訓練課程中過度擬合了特定格式的獎勵訊號,而非真正習得邏輯推理能力。
  • 社群討論指出,針對小模型進行 GRPO 訓練時,若未嚴格控制 KL 散度(KL Divergence)懲罰係數,極易導致模型輸出退化為重複性文字。

🛠️ 技術深入

  • GRPO 演算法架構:透過從單一提示(Prompt)採樣一組輸出,並根據這些輸出的相對獎勵計算優勢函數(Advantage),省去了傳統 PPO 中 Critic 模型的記憶體開銷。
  • 訓練不穩定性因素:在小模型中,由於參數空間較小,GRPO 的策略梯度更新容易導致權重劇烈震盪,特別是在缺乏足夠的正規化(Regularization)時。
  • 獎勵稀疏性問題:實驗中提到的課程學習(Curriculum Learning)若未配合適當的停止獎勵(Stop Reward),模型會傾向於生成冗長但無意義的推理步驟以騙取獎勵。
  • 規模效應(Scaling Laws):實驗結果暗示 GRPO 可能存在一個臨界參數規模,低於此規模時,強化學習帶來的增益無法抵銷語言模型基礎能力的損失。

🔮 前景展望AI analysis grounded in cited sources

GRPO 將轉向結合更穩定的價值基準線。
為了解決小模型訓練的不穩定性,未來的 GRPO 變體可能會引入輕量級的 Critic 模型以降低策略更新的方差。
強化學習訓練將更依賴於合成資料的品質而非數量。
實驗顯示單純增加訓練課程無法解決遷移問題,暗示獎勵訊號的精確度將成為模型推理能力提升的關鍵。

時間線

2024-02
DeepSeek 發布 GRPO 演算法論文,提出無需 Critic 模型的強化學習優化方法。
2025-01
DeepSeek-R1 正式發布,驗證了 GRPO 在大規模推理模型上的有效性。
2026-05
開源社群開始嘗試將 GRPO 應用於 sub-1B 參數模型,並陸續回報訓練不穩定問題。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning