📄ArXiv AI•較早收集於 20h
RL分解達成主張驗證SOTA

#claim-verification#fact-checkingdistill-align-decompositionarxivgrpo
💡8B模型經RL達主張驗證SOTA:+6%勝基準,人評通過(78字)
⚡ 30-Second TL;DR
有什麼變化
GRPO RL共同優化分解與驗證器對齊
為什麼重要
讓8B模型達成主張驗證SOTA,提升LLM事實查核。降低分解任務對大型模型依賴。擴展至其他多步驟推理應用。
下一步行動
下載arXiv:2602.21857並訓練GRPO分解器用於NLP驗證任務。
誰應關注:Researchers & Academics
關鍵要點
- •GRPO RL共同優化分解與驗證器對齊
- •結合序列推理、蒸餾範例監督微調
- •多目標獎勵涵蓋格式、對齊、品質
- •71.75% macro-F1勝提示(+6.24%)與舊RL(+5.84%)
- •人工評估確認子主張高品質
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
🛠️ 技術深入
GRPO核心機制與改進
-
損失函數:GRPO採用與PPO相同的裁剪機制處理重要性比率,在群組層級聚合多個完成序列的損失,公式為: $$\mathcal{L}{\text{GRPO}}(\theta) = \mathbb{E}\left[\frac{1}{G}\sum{i=1}^{G}\frac{1}{|y_i|}\sum_{t=1}^{|y_i|}\min\left(p_{i,t}(\theta)A_i, \text{clipped ratio}\right)\right]$$[3]
-
- 回應層級長度偏差:標準化損失時未考慮序列長度差異
- 問題層級難度偏差:標準差項導致簡單/困難問題的優勢值過大
-
DAPO改進方案[4]:
- 移除易於猜測的問題(選擇題、真假題)以防止虛假正例
- 實施軟硬長度懲罰機制(16k上下文中於12k開始線性增加)
- 每令牌分配優勢而非僅終端令牌
-
多目標獎勵設計[1]:整合格式合規性、驗證器對齐、分解品質三個目標,透過教師蒸餾範例進行監督微調
-
驗證機制[3]:結合規則型步驟驗證與神經判斷,提供可驗證的過程監督而非僅終端結果驗證
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2024-11
GRPO演算法由Shao等人提出,成為LLM推理對齐的實用方法[3]
2025-01
DAPO(Distributed Advantage Policy Optimization)發表,改進GRPO的偏差問題[4]
2025-02
Wen等人發表理論結果,證明GRPO和DAPO目標的收斂性質[3]
2025-12
iGRPO(迭代GRPO)提出,引入動態自我條件化機制用於多輪推理[6]
2026-01
TL-GRPO和Verifiable Process Reward Models發表,針對迭代優化和結構化推理任務[3][7]
2026-02
本文提出的分解與驗證聯合優化方法提交至EACL Findings 2026,8B模型達SOTA性能[1]
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。