
MAGE:元強化學習驅動策略性語言代理
MAGE 是一種元強化學習框架,讓大型語言模型代理在多代理環境中具備策略性探索與利用能力。它採用多回合訓練,將互動歷史與反思整合進上下文視窗,並以最終回合獎勵作為優化目標。實驗顯示其超越基準,並對未見對手展現強大泛化能力。
Tag: #llm-agents89 results

MAGE 是一種元強化學習框架,讓大型語言模型代理在多代理環境中具備策略性探索與利用能力。它採用多回合訓練,將互動歷史與反思整合進上下文視窗,並以最終回合獎勵作為優化目標。實驗顯示其超越基準,並對未見對手展現強大泛化能力。

AgentSelect 推出用於基於敘事查詢推薦 LLM 代理配置的基準,解決缺乏查詢條件監督的問題。它彙總來自 40 多個來源的 111,179 個查詢、107,721 個代理和 251,103 個互動記錄,轉換為統一資料。分析顯示從密集頭重用轉向長尾監督,並強調內容感知能力匹配的必要性。

ARLArena 提供穩定訓練配方與分析框架,用以解決代理強化學習 (ARL) 的訓練崩潰問題。它將策略梯度分解為四個核心維度,並提出 SAMPO 方法來緩解主要不穩定來源。SAMPO 在多樣代理任務中實現一致穩定訓練與優異效能。

LightMem 是一款輕量級大模型記憶系統,在長對話與多任務代理中不犧牲準確率的前提下,大幅降低 token 使用、API 呼叫次數與延遲。它透過模仿人類分層記憶機制,解決對話冗餘、僵硬切分與昂貴線上更新的問題。論文入選 ICLR 2026,並提供開源程式碼。

斯坦福研究團隊提出「執行落地型自動科研」系統,將科研問題轉化為LLM可反覆試錯的環境,透過程式碼執行與反饋迭代優化想法。系統在兩個基準環境應用進化搜尋與獎勵學習:加速nanoGPT預訓練,以及提升GRPO在MATH任務的後訓練效果。核心模組包含Implementer、Scheduler與Worker,實現自動化想法演化。

ISEE 是一套互動式系統,可評估資料庫欄位描述的品質,並與使用者合作補充缺失的領域語意。評估結果顯示,ISEE 能降低認知負擔、改善描述品質,並提升實體連結等下游任務的表現。
Research Radar 是一款開源工具,透過根據使用者定義的研究興趣對 arXiv 論文進行評分,實現每日論文監控自動化。它利用多階段 LLM 流程篩選相關論文並生成深度摘要,大幅節省研究人員的時間。

本研究探討 LLM 代理人是否能透過自組織而非依賴預定義的角色或工作流程來實現卓越的協同效應。研究應用組織心理學來評估不受約束的代理人互動如何影響團隊績效。

GLARE 是一個基於 LLM 的互動式介面,允許使用者使用自然語言查詢黑盒影像分類器的全域解釋。該系統將使用者查詢轉換為 SQL 以聚合局部解釋數據,並提供統計增強的回答與視覺化圖表。
作者認為以 Token 計價是衡量 LLM 成本的誤導性指標,因為它忽略了多步驟代理工作流程中的「驗證稅」與可靠性衰減。真實成本必須考量隨著鏈長增加而呈幾何級數增長的失敗率。