Search

直接匹配不多,已補上最新動態。

Tag: #reasoning-stability2 results

StaRPO:穩定強化學習提升推理可靠性

StaRPO:穩定強化學習提升推理可靠性

StaRPO 提出穩定性增強的強化學習框架,用於大型語言模型,透過 ACF 評估局部連貫性和 PE 評估全局目標導向性,將其與任務獎勵結合提供過程感知反饋。在四個推理基準測試中,顯示出優於基準的準確性和邏輯穩定性。

ArXiv AIResearchApr 13#reasoning-stability#rlhf