📄較早收集於 23h

AEM 提升代理強化學習訓練

AEM 提升代理強化學習訓練
PostLinkedIn
📄閱讀原文: ArXiv AI

💡無監督 RL 助 LLM 代理 SWE-bench 獲 1.4% 提升(無額外調校)

⚡ 30-Second TL;DR

有什麼變化

無監督熵調製用於 RL 信用分配

為什麼重要

無需密集獎勵簡化多輪代理訓練,便於 RLHF 管道廣泛採用。潛在提升 LLM 代理在編碼基準等複雜任務的能力。

下一步行動

將 AEM 熵調製整合至 PPO 訓練器,用於 LLM 代理 RL 微調。

誰應關注:Researchers & Academics

關鍵要點

  • 無監督熵調製用於 RL 信用分配
  • 回應層級熵分析減少 token 採樣變異
  • SWE-bench-Verified 基準獲 1.4% 提升
  • 適用於 1.5B-32B 參數模型
  • 優勢-驚奇度乘積的熵漂移理論代理

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • AEM 透過將「優勢-驚奇度乘積」(Advantage-Surprise Product)作為熵漂移的代理指標,解決了傳統 RL 在長序列任務中信用分配稀疏的問題。
  • 該方法利用自然梯度(Natural Gradient)理論,在優化過程中對策略分佈進行幾何約束,從而顯著降低了 LLM 在生成長文本時的 token 採樣方差。
  • 研究表明 AEM 能夠有效緩解 LLM 代理在複雜軟體工程任務(如 SWE-bench)中常見的「過度探索」或「過早收斂」問題,提升了代理在多步驟推理中的穩定性。

🛠️ 技術深入

• 核心機制:採用無監督熵調製(Unsupervised Entropy Modulation),動態調整策略分佈的熵值,而非依賴預定義的溫度參數。 • 數學基礎:基於自然梯度下降(Natural Gradient Descent),在參數空間中沿著 KL 散度約束的方向更新策略,確保訓練過程的穩定性。 • 信用分配:將回應層級的熵與優勢函數(Advantage Function)結合,計算出每個 token 的權重,從而實現細粒度的信用分配。 • 適用範圍:針對 1.5B 到 32B 參數規模的 LLM 進行了優化,特別是在需要長上下文推理的任務中表現出顯著的性能增益。

🔮 前景展望AI analysis grounded in cited sources

AEM 將成為開源 LLM 代理訓練的標準化優化模組。
其無監督特性降低了對大規模人工標註數據的依賴,且能與現有的 RLHF 流程兼容。
該技術將顯著縮短複雜軟體開發代理的訓練週期。
透過更高效的信用分配,模型能更快學會長序列任務中的關鍵決策路徑,減少無效探索。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI