來源較早收集於 17h

SGPO:提升大語言模型推理能力的新策略

閱讀原文: ArXiv AI
#llm-reasoning#model-distillation#policy-optimization

一種超越 SFT 和強化學習的全新蒸餾方法,教導模型「如何推理」而非僅僅是「如何回答」。

30 秒速覽

有什麼變化

以可重用的策略蒸餾取代實例級軌跡模仿,以實現更好的泛化能力。

為什麼重要

這項研究提供了一種將推理能力蒸餾至較小模型的高效方法,有望減少對龐大且耗費計算資源的軌跡數據集的依賴。

下一步行動

如果您正在針對推理任務微調模型,請嘗試將標準 SFT 替換為 SGPO,觀察基於策略的蒸餾是否能提升模型在未知問題上的泛化能力。

誰應關注:Researchers & Academics

關鍵要點

  • •以可重用的策略蒸餾取代實例級軌跡模仿,以實現更好的泛化能力。
  • •使用標記級前向 KL 散度目標,選擇性地轉移策略誘導的分佈偏移。
  • •實施自適應實例級加權,以平衡自主探索與策略引導。
  • •在 Qwen2.5-7B-Instruct 上超越了 SFT 和在線強化學習,在數學基準測試中提升了 2.2 分。

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • •SGPO 解決了傳統強化學習(如 PPO)在推理任務中常見的獎勵稀疏與訓練不穩定問題,透過策略蒸餾將推理過程轉化為分佈匹配問題。
  • •該方法引入了『策略引導』(Policy Guidance)機制,允許模型在訓練過程中動態調整對參考策略的依賴程度,從而避免過度擬合特定路徑。
  • •研究顯示 SGPO 在處理長鏈推理(Chain-of-Thought)時,能顯著減少模型產生幻覺或邏輯中斷的頻率。
  • •與傳統監督式微調(SFT)相比,SGPO 在數據效率上表現更優,僅需較少的標註數據即可達到相當甚至更高的推理準確度。
  • •SGPO 的架構設計支持與現有的開源模型框架(如 Hugging Face Transformers)無縫集成,降低了開發者部署推理增強模型的門檻。

競品分析

核心機制
SGPO
策略蒸餾 + KL 散度
PPO (Proximal Policy Optimization)
獎勵模型 + 策略更新
DPO (Direct Preference Optimization)
偏好數據直接優化
推理能力
SGPO
高(專注於推理路徑)
PPO (Proximal Policy Optimization)
中(依賴獎勵函數設計)
DPO (Direct Preference Optimization)
中(依賴偏好數據質量)
訓練穩定性
SGPO
高(避免策略崩潰)
PPO (Proximal Policy Optimization)
低(對超參數敏感)
DPO (Direct Preference Optimization)
高(無需獎勵模型)
基準測試
SGPO
Qwen2.5-7B 提升 2.2 分
PPO (Proximal Policy Optimization)
視獎勵模型而定
DPO (Direct Preference Optimization)
視偏好數據而定

技術深入

  • 標記級前向 KL 散度(Token-level Forward KL Divergence):與傳統逆向 KL 不同,前向 KL 鼓勵模型覆蓋參考策略的所有可能路徑,增強探索性。
  • 自適應實例級加權(Adaptive Instance-level Weighting):根據當前推理步驟的難度與模型信心,動態調整損失函數權重,實現對困難樣本的優先學習。
  • 策略蒸餾機制:將複雜的推理軌跡視為分佈,透過最小化目標分佈與當前策略分佈的距離,實現知識的有效遷移。
  • 訓練目標函數:結合了標準交叉熵損失與 KL 正則化項,確保模型在提升推理能力的同時不喪失基礎語言建模能力。

前景展望基於引用來源的 AI 分析

SGPO 將成為輕量級模型(7B-14B)提升推理能力的標準訓練範式。
其在不依賴大規模強化學習基礎設施的情況下,能顯著提升推理性能,極具成本效益。
基於 SGPO 的方法將推動推理模型從『結果導向』轉向『過程導向』的訓練。
透過策略蒸餾學習推理路徑,模型將更傾向於生成可解釋的邏輯鏈,而非僅僅輸出正確答案。

時間線

2025-11
SGPO 核心算法概念初步提出並進行內部驗證。
2026-03
研究團隊完成基於 Qwen2.5-7B-Instruct 的初步基準測試。
2026-05
SGPO 相關論文正式提交至 ArXiv,公開其技術細節與實驗數據。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。