🤖Reddit r/MachineLearning•較早收集於 5h
RLVR 勝 SFT:Qwen2.5 數學 +11.9 分

#fine-tuning#reasoning#rlhfqwen2.5-1.5b-rlvrqwen2.5-1.5brlvrgrpogsm8ksft
💡RLVR 單例 Qwen2.5 數學 +12 分—SFT 損推理。檢查點上線。
⚡ 30-Second TL;DR
有什麼變化
RLVR GSM8K +11.9 分,甚至單例泛化至 MATH
為什麼重要
證明 RLVR 優於 SFT 的推理能力,即使少量資料高效訓練;影響開源模型微調策略。
下一步行動
使用 github.com/jayminban/RLVR-vs-SFT-Qwen2.5-1.5b 的 GRPO 微調模型。
誰應關注:Researchers & Academics
關鍵要點
- •RLVR GSM8K +11.9 分,甚至單例泛化至 MATH
- •SFT GSM8K -15.2 分,覆寫預訓練知識
- •基準測試 388 檢查點,SQLite DB 240 萬列
- •GRPO 使用 6-8x RTX GPU,程式碼/檢查點在 GitHub
- •降低無答率但損害準確度
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
🔮 前景展望AI analysis grounded in cited sources
RLVR訓練方法將成為小型模型數學微調標準
Qwen2.5-1.5B使用RLVR在GSM8K提升11.9分並泛化至MATH,證明其優於SFT避免覆寫預訓練知識[1原文章]
Qwen2.5-Math專家模型推動開源數學AI民主化
小型Qwen2.5-Math-1.5B-Instruct即競爭大型模型,結合低資源GRPO訓練降低部署門檻[2]
⏳ 時間線
2024-09
Qwen2.5系列發佈,包含數學專用模型並提升推理能力
2025-11
Qwen2.5-Max及Qwen3-Next推出,參數超1兆採用MoE架構
2026-03
Reddit發佈RLVR勝SFT實驗結果,Qwen2.5-1.5B數學提升11.9分
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。
