Search

Tag: #reward-model5 results

人類引導式電腦使用代理危害恢復

人類引導式電腦使用代理危害恢復

研究人員為在電腦上執行動作的大型語言模型代理形式化危害恢復,從危害狀態引導回安全狀態,符合人類偏好。使用者研究產生1,150個成對判斷資料集及評分表,用於獎勵模型重新排序恢復計劃。BackBench基準測試包含50個任務,顯示優於基準的恢復表現。

港中文聯合美團為Agent添加「過程分」

港中文聯合美團為Agent添加「過程分」

港中文與美團研究人員開發了 Agent-RRM,一種獎勵模型,能評分整個 Agent 軌跡的推理品質與工具使用,而非僅看最終結果。他們整理了註解軌跡數據集,並建置 Reagent 框架,將文字反饋與分數整合進訓練。此舉解決多步驟任務如網路搜尋與程式碼撰寫中的稀疏獎勵問題。

机器之心MediaFeb 20#reward-model#agent-training