📄較早收集於 20h

RL分解達成主張驗證SOTA

RL分解達成主張驗證SOTA
PostLinkedIn
📄閱讀原文: ArXiv AI
#claim-verification#fact-checkingdistill-align-decompositionarxivgrpo

💡8B模型經RL達主張驗證SOTA:+6%勝基準,人評通過(78字)

⚡ 30-Second TL;DR

有什麼變化

GRPO RL共同優化分解與驗證器對齊

為什麼重要

讓8B模型達成主張驗證SOTA,提升LLM事實查核。降低分解任務對大型模型依賴。擴展至其他多步驟推理應用。

下一步行動

下載arXiv:2602.21857並訓練GRPO分解器用於NLP驗證任務。

誰應關注:Researchers & Academics

關鍵要點

  • GRPO RL共同優化分解與驗證器對齊
  • 結合序列推理、蒸餾範例監督微調
  • 多目標獎勵涵蓋格式、對齊、品質
  • 71.75% macro-F1勝提示(+6.24%)與舊RL(+5.84%)
  • 人工評估確認子主張高品質

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 9 個來源。

🔑 增強重點摘要

  • GRPO演算法已成為2025-2026年LLM推理對齐的主流方法,衍生出多個變體(DAPO、iGRPO、TL-GRPO、MT-GRPO)以解決特定推理場景的限制[2][4][5][6][7]
  • GRPO存在已知的技術缺陷,包括回應長度偏差和問題難度偏差,導致梯度更新不均勻,最近的改進方法透過標準化和軟懲罰機制來修正[2][4]
  • 多目標獎勵框架已被驗證可改善小型語言模型(8B參數)的推理性能,使其達到與大型模型競爭的SOTA結果,同時降低計算成本[1]

🛠️ 技術深入

GRPO核心機制與改進

  • 損失函數:GRPO採用與PPO相同的裁剪機制處理重要性比率,在群組層級聚合多個完成序列的損失,公式為: $$\mathcal{L}{\text{GRPO}}(\theta) = \mathbb{E}\left[\frac{1}{G}\sum{i=1}^{G}\frac{1}{|y_i|}\sum_{t=1}^{|y_i|}\min\left(p_{i,t}(\theta)A_i, \text{clipped ratio}\right)\right]$$[3]

  • 已識別的偏差問題[2][4]

    • 回應層級長度偏差:標準化損失時未考慮序列長度差異
    • 問題層級難度偏差:標準差項導致簡單/困難問題的優勢值過大
  • DAPO改進方案[4]

    • 移除易於猜測的問題(選擇題、真假題)以防止虛假正例
    • 實施軟硬長度懲罰機制(16k上下文中於12k開始線性增加)
    • 每令牌分配優勢而非僅終端令牌
  • 多目標獎勵設計[1]:整合格式合規性、驗證器對齐、分解品質三個目標,透過教師蒸餾範例進行監督微調

  • 驗證機制[3]:結合規則型步驟驗證與神經判斷,提供可驗證的過程監督而非僅終端結果驗證

🔮 前景展望AI analysis grounded in cited sources

GRPO變體的收斂將推動標準化框架出現
多個獨立團隊在2025-2026年開發DAPO、iGRPO、TL-GRPO等變體,表明基礎演算法需要系統性改進,未來可能出現統一的改進版本標準[4][5][6][7]
小型模型(8B)將成為推理任務的主流部署單位
本研究證明8B模型透過GRPO優化可達71.75% macro-F1,相較於提示方法提升6.24%,降低推理成本同時保持SOTA性能[1]
多任務推理訓練將成為可靠性的關鍵指標
MT-GRPO在最差任務準確度上相較標準GRPO提升16-28%,表明單任務優化可能導致泛化失敗,未來評估將強調跨任務穩健性[5]

時間線

2024-11
GRPO演算法由Shao等人提出,成為LLM推理對齐的實用方法[3]
2025-01
DAPO(Distributed Advantage Policy Optimization)發表,改進GRPO的偏差問題[4]
2025-02
Wen等人發表理論結果,證明GRPO和DAPO目標的收斂性質[3]
2025-12
iGRPO(迭代GRPO)提出,引入動態自我條件化機制用於多輪推理[6]
2026-01
TL-GRPO和Verifiable Process Reward Models發表,針對迭代優化和結構化推理任務[3][7]
2026-02
本文提出的分解與驗證聯合優化方法提交至EACL Findings 2026,8B模型達SOTA性能[1]
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。