Search

Tag: #reward-modeling6 results

評分表革新多模態AI獎勵

評分表革新多模態AI獎勵

ARR框架將VLM偏好外部化為明確、可檢視的評分表,用於獎勵建模,抑制如位置偏差等偏差,支持零樣本部署。RPO將這些多維評估蒸餾為穩定的二元獎勵,用於生成訓練。在文字轉圖像和圖像編輯基準上,優於成對RLHF和VLM評判。

PAPO 透過解耦正規化穩定評分表訓練

PAPO 透過解耦正規化穩定評分表訓練

程序感知策略優化(PAPO)透過解耦優勢正規化,將基於評分表的程序評估整合至 GRPO,以解決 ORM 的均勻正確性問題及 PRM 的獎勵駭客問題。它組合全域正規化的結果優勢(Aout)與僅正確回應正規化的程序優勢(Aproc)。PAPO 在基準測試中勝過基線,在 OlympiadBench 達 51.3%,優於 ORM 的 46.3%。

BNRM Prevents Reward Hacking in RLHF

BNRM Prevents Reward Hacking in RLHF

BNRM introduces Bayesian non-negative reward modeling to combat reward hacking in RLHF. It uses sparse latent factors for disentangled, debiased rewards. Scalable amortized VI enables end-to-end training on LLMs.

ArXiv AIResearchFeb 12#research#bnrm#v1