
Sci-PRM:用於科學推理的工具感知獎勵模型
Sci-PRM 是一種新型過程獎勵模型,旨在透過整合工具執行與邏輯驗證來提升科學推理能力。它利用 SCIPRM70K 資料集,針對工具選擇與結果解釋提供細粒度的監督,有效減少複雜科學領域中的幻覺問題。
Tag: #reward-model5 results

Sci-PRM 是一種新型過程獎勵模型,旨在透過整合工具執行與邏輯驗證來提升科學推理能力。它利用 SCIPRM70K 資料集,針對工具選擇與結果解釋提供細粒度的監督,有效減少複雜科學領域中的幻覺問題。

研究人員為在電腦上執行動作的大型語言模型代理形式化危害恢復,從危害狀態引導回安全狀態,符合人類偏好。使用者研究產生1,150個成對判斷資料集及評分表,用於獎勵模型重新排序恢復計劃。BackBench基準測試包含50個任務,顯示優於基準的恢復表現。

ARES提出一個框架,用以發現並修復RLHF中LLM與獎勵模型共同失效的系統性弱點。它使用Safety Mentor生成針對兩者的對抗提示與回應。兩階段修復流程先微調RM,再優化核心模型,在基準測試上提升安全性而不損能力。

港中文與美團研究人員開發了 Agent-RRM,一種獎勵模型,能評分整個 Agent 軌跡的推理品質與工具使用,而非僅看最終結果。他們整理了註解軌跡數據集,並建置 Reagent 框架,將文字反饋與分數整合進訓練。此舉解決多步驟任務如網路搜尋與程式碼撰寫中的稀疏獎勵問題。

實證研究檢驗 LLM 道德對齊是否需要多樣性尋求方法而非獎勵最大化 RLVR。在 MoReBench 上,獎勵最大化方法與分佈匹配方法相當或更優。道德推理呈現高獎勵回應集中分佈,不同於數學的多樣解法。