Search

直接匹配不多,已補上最新動態。

Tag: #entropy-modulation1 results

AEM 提升代理強化學習訓練

AEM 提升代理強化學習訓練

AEM 是一種無監督信用分配方法,透過自適應調製 RL 中 LLM 代理的熵,提升探索-利用平衡。將熵分析提升至回應層級,透過自然梯度理論洞見減少 token 變異。實驗顯示在 1.5B-32B 模型上 SWE-bench-Verified 獲 1.4% 提升。

ArXiv AIResearchMay 5#llm-agents#entropy-modulation