🤖較早收集於 5h

RLVR 勝 SFT:Qwen2.5 數學 +11.9 分

RLVR 勝 SFT:Qwen2.5 數學 +11.9 分
PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#fine-tuning#reasoning#rlhfqwen2.5-1.5b-rlvrqwen2.5-1.5brlvrgrpogsm8ksft

💡RLVR 單例 Qwen2.5 數學 +12 分—SFT 損推理。檢查點上線。

⚡ 30-Second TL;DR

有什麼變化

RLVR GSM8K +11.9 分,甚至單例泛化至 MATH

為什麼重要

證明 RLVR 優於 SFT 的推理能力,即使少量資料高效訓練;影響開源模型微調策略。

下一步行動

使用 github.com/jayminban/RLVR-vs-SFT-Qwen2.5-1.5b 的 GRPO 微調模型。

誰應關注:Researchers & Academics

關鍵要點

  • RLVR GSM8K +11.9 分,甚至單例泛化至 MATH
  • SFT GSM8K -15.2 分,覆寫預訓練知識
  • 基準測試 388 檢查點,SQLite DB 240 萬列
  • GRPO 使用 6-8x RTX GPU,程式碼/檢查點在 GitHub
  • 降低無答率但損害準確度

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen2.5-Math-1.5B-Instruct模型在數學基準測試中表現優異,甚至超越大型語言模型如GPT-4o[2]
  • Qwen2.5系列支援長文本生成超過8K tokens,並提升結構化數據理解與JSON輸出生成[2][4]
  • Qwen2.5-72B-Instruct在MATH基準達83.1分,LiveCodeBench 55.5分,超越Llama-3.1-405B部分任務[4]

🔮 前景展望AI analysis grounded in cited sources

RLVR訓練方法將成為小型模型數學微調標準
Qwen2.5-1.5B使用RLVR在GSM8K提升11.9分並泛化至MATH,證明其優於SFT避免覆寫預訓練知識[1原文章]
Qwen2.5-Math專家模型推動開源數學AI民主化
小型Qwen2.5-Math-1.5B-Instruct即競爭大型模型,結合低資源GRPO訓練降低部署門檻[2]

時間線

2024-09
Qwen2.5系列發佈,包含數學專用模型並提升推理能力
2025-11
Qwen2.5-Max及Qwen3-Next推出,參數超1兆採用MoE架構
2026-03
Reddit發佈RLVR勝SFT實驗結果,Qwen2.5-1.5B數學提升11.9分
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。