
LLM 評審在壓力下反覆改判
Wiggle Framework 透過重新提示、單次挑戰與持續說服,測試 LLM 評審的穩定性。在 9 個前沿模型與 14 項評審任務中,模型頻繁改變判決,而成功施壓幾乎總是損害其與真實答案的一致性。
Tag: #reward-modeling6 results

Wiggle Framework 透過重新提示、單次挑戰與持續說服,測試 LLM 評審的穩定性。在 9 個前沿模型與 14 項評審任務中,模型頻繁改變判決,而成功施壓幾乎總是損害其與真實答案的一致性。

這項研究指出,隨著 AI 模型在程式碼生成能力上的提升,真正的挑戰已轉向如何可靠地驗證這些解決方案。作者提出了一個聚焦於可擴展性、忠實度與穩健性的框架,以減輕獎勵駭客(reward hacking)的問題。

ARR框架將VLM偏好外部化為明確、可檢視的評分表,用於獎勵建模,抑制如位置偏差等偏差,支持零樣本部署。RPO將這些多維評估蒸餾為穩定的二元獎勵,用於生成訓練。在文字轉圖像和圖像編輯基準上,優於成對RLHF和VLM評判。

程序感知策略優化(PAPO)透過解耦優勢正規化,將基於評分表的程序評估整合至 GRPO,以解決 ORM 的均勻正確性問題及 PRM 的獎勵駭客問題。它組合全域正規化的結果優勢(Aout)與僅正確回應正規化的程序優勢(Aproc)。PAPO 在基準測試中勝過基線,在 OlympiadBench 達 51.3%,優於 ORM 的 46.3%。

西安交通大學與 A*STAR 的 PaCo-RL 透過 VLM 成對獎勵建模,用於 RL 訓練一致影像生成。PaCo-Reward 在 ConsistencyRank 準確率達 0.449(較基準 +10%)。在 Text-to-ImageSet 一致性提升 10%以上,低解析訓練減半時間。
BNRM introduces Bayesian non-negative reward modeling to combat reward hacking in RLHF. It uses sparse latent factors for disentangled, debiased rewards. Scalable amortized VI enables end-to-end training on LLMs.