Search

直接匹配不多,已補上最新動態。

Tag: #policy-optimization3 results

Apple PORTool 提升多工具 LLM 推理

Apple PORTool 提升多工具 LLM 推理

Apple 推出 PORTool,一種具重要性感知的政策優化演算法,使用獎勵樹訓練 LLM 工具使用代理。透過從結果監督分配步驟級獎勵,解決信用分配模糊問題。這能更好地強化複雜任務中的中間推理與工具決策。

Apple Machine LearningOfficialMay 4#tool-agents#policy-optimization
PAPO 透過解耦正規化穩定評分表訓練

PAPO 透過解耦正規化穩定評分表訓練

程序感知策略優化(PAPO)透過解耦優勢正規化,將基於評分表的程序評估整合至 GRPO,以解決 ORM 的均勻正確性問題及 PRM 的獎勵駭客問題。它組合全域正規化的結果優勢(Aout)與僅正確回應正規化的程序優勢(Aproc)。PAPO 在基準測試中勝過基線,在 OlympiadBench 達 51.3%,優於 ORM 的 46.3%。