Search

直接匹配不多,已補上最新動態。

Tag: #harm-recovery1 results

人類引導式電腦使用代理危害恢復

人類引導式電腦使用代理危害恢復

研究人員為在電腦上執行動作的大型語言模型代理形式化危害恢復,從危害狀態引導回安全狀態,符合人類偏好。使用者研究產生1,150個成對判斷資料集及評分表,用於獎勵模型重新排序恢復計劃。BackBench基準測試包含50個任務,顯示優於基準的恢復表現。