
AEM 提升代理強化學習訓練
AEM 是一種無監督信用分配方法,透過自適應調製 RL 中 LLM 代理的熵,提升探索-利用平衡。將熵分析提升至回應層級,透過自然梯度理論洞見減少 token 變異。實驗顯示在 1.5B-32B 模型上 SWE-bench-Verified 獲 1.4% 提升。
Tag: #llm-agents89 results

AEM 是一種無監督信用分配方法,透過自適應調製 RL 中 LLM 代理的熵,提升探索-利用平衡。將熵分析提升至回應層級,透過自然梯度理論洞見減少 token 變異。實驗顯示在 1.5B-32B 模型上 SWE-bench-Verified 獲 1.4% 提升。

Analytica 引入軟命題推理(SPR)來穩定 LLM 代理在預測等複雜分析任務中表現。它將任務分解為子命題,使用包括 Jupyter Notebook 代理在內的工具代理進行 grounding,並透過線性模型合成以降低偏差與變異。平均準確率提升 15.84%,最高達 71% 且變異僅 6%。

2026 年 3 月,三個 LLM 代理生成超過 60 萬行程式碼,執行 850 個實驗,在 Kaggle 遊樂場競賽中獲得第一名。結合 GPU 加速,它們大幅壓縮了現代機器學習競賽中的構想生成、測試和迭代循環。

自主LLM代理從資料中端到端開發材料理論,選擇方程式、執行程式碼並驗證擬合度,無需人工介入。它在Hall-Petch和Paris定律等已知關係上表現出色,提出如應變依賴HOMO-LUMO間隙的新定律,GPT-5表現更優。儘管擬合強,仍需嚴格驗證以防錯誤。

研究人員提出大型語言模型代理技能的雙層優化框架,外層使用蒙地卡羅樹搜尋決定技能結構,內層使用 LLM 精煉內容。此方法解決技能設計中結構與組件的相互依賴。於開源營運研究問答資料集實驗顯示代理效能提升。

WebXSkill 透過可執行技能彌補 LLM 驅動網頁代理的接地差距,將動作程式與自然語言指導配對。它包含三階段:從合成軌跡提取技能、URL 圖組織,以及雙重部署模式。在 WebArena 和 WebVoyager 上成功率提升最高 9.8% 和 12.9%;程式碼已開源。

基於LLM的代理可能犯下政策隱形違規,即決策脈絡中缺少關鍵事實。PhantomPolicy基準涵蓋八類違規,包含五個前沿模型的600條人工審核追蹤。Sentinel執行框架利用反事實圖模擬,於追蹤層級標籤達93%準確率。

推出 HORIZON 基準測試,用以系統診斷 LLM 代理在跨領域長視野任務的失敗。評估 GPT-5 變體與 Claude 等 SOTA 模型,涵蓋 3100+ 軌跡,揭示退化模式。發布排行榜與經人類註解驗證(κ=0.84)的 LLM-as-a-Judge 流程。

矽鏡框架動態偵測 LLM 使用者說服策略,並閘控行為以維持事實準確性。在 437 個 TruthfulQA 情境中,將 Claude Sonnet 4 的奉承率從 9.6% 降至 1.4%(減 85.7%)。Gemini 2.5 Flash 也有類似改善。
在 NanoChat 上的實驗顯示,AutoResearch 收斂更快、成本更低,且泛化能力優於 Optuna。它在樣本效率上表現出色,儘管每步驟成本高 2 倍,仍橫跨所有預算範圍佔優。後期迭代開始探索超出參數調整的程式碼變更。