📄ArXiv AI•較早收集於 23h
AEM 提升代理強化學習訓練

💡無監督 RL 助 LLM 代理 SWE-bench 獲 1.4% 提升(無額外調校)
⚡ 30-Second TL;DR
有什麼變化
無監督熵調製用於 RL 信用分配
為什麼重要
無需密集獎勵簡化多輪代理訓練,便於 RLHF 管道廣泛採用。潛在提升 LLM 代理在編碼基準等複雜任務的能力。
下一步行動
將 AEM 熵調製整合至 PPO 訓練器,用於 LLM 代理 RL 微調。
誰應關注:Researchers & Academics
關鍵要點
- •無監督熵調製用於 RL 信用分配
- •回應層級熵分析減少 token 採樣變異
- •SWE-bench-Verified 基準獲 1.4% 提升
- •適用於 1.5B-32B 參數模型
- •優勢-驚奇度乘積的熵漂移理論代理
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •AEM 透過將「優勢-驚奇度乘積」(Advantage-Surprise Product)作為熵漂移的代理指標,解決了傳統 RL 在長序列任務中信用分配稀疏的問題。
- •該方法利用自然梯度(Natural Gradient)理論,在優化過程中對策略分佈進行幾何約束,從而顯著降低了 LLM 在生成長文本時的 token 採樣方差。
- •研究表明 AEM 能夠有效緩解 LLM 代理在複雜軟體工程任務(如 SWE-bench)中常見的「過度探索」或「過早收斂」問題,提升了代理在多步驟推理中的穩定性。
🛠️ 技術深入
• 核心機制:採用無監督熵調製(Unsupervised Entropy Modulation),動態調整策略分佈的熵值,而非依賴預定義的溫度參數。 • 數學基礎:基於自然梯度下降(Natural Gradient Descent),在參數空間中沿著 KL 散度約束的方向更新策略,確保訓練過程的穩定性。 • 信用分配:將回應層級的熵與優勢函數(Advantage Function)結合,計算出每個 token 的權重,從而實現細粒度的信用分配。 • 適用範圍:針對 1.5B 到 32B 參數規模的 LLM 進行了優化,特別是在需要長上下文推理的任務中表現出顯著的性能增益。
🔮 前景展望AI analysis grounded in cited sources
AEM 將成為開源 LLM 代理訓練的標準化優化模組。
其無監督特性降低了對大規模人工標註數據的依賴,且能與現有的 RLHF 流程兼容。
該技術將顯著縮短複雜軟體開發代理的訓練週期。
透過更高效的信用分配,模型能更快學會長序列任務中的關鍵決策路徑,減少無效探索。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗