
MiRA 強化開源 LLM 代理超越 GPT-4
研究人員提出子目標驅動框架與 MiRA RL 方法,解決 LLM 代理在網頁導航的長時程規劃問題。MiRA 將 Gemma3-12B 在 WebArena-Lite 的成功率從 6.4% 提升至 43%,超越 GPT-4-Turbo (17.6%) 與 GPT-4o (13.9%)。此規劃與里程碑獎勵組合提升自主 AI 能力。
Tag: #long-horizon8 results

研究人員提出子目標驅動框架與 MiRA RL 方法,解決 LLM 代理在網頁導航的長時程規劃問題。MiRA 將 Gemma3-12B 在 WebArena-Lite 的成功率從 6.4% 提升至 43%,超越 GPT-4-Turbo (17.6%) 與 GPT-4o (13.9%)。此規劃與里程碑獎勵組合提升自主 AI 能力。
ResearchGym 推出一個基準,包含來自 ICML、ICLR 和 ACL 論文的五個容器化環境,總共 39 個子任務,代理需提出假設並執行實驗以超越基準。GPT-5 驅動的代理顯示能力-可靠性差距,仅在 6.7% 的評估中成功,並平均完成 26.5% 的子任務。它識別關鍵失敗模式,如不耐煩和資源管理不善,偶爾不可靠地達成 SOTA 成果。

COSPLAY是一個共同演化框架,其中LLM決策代理從可學習技能庫檢索技能來引導行動,同時技能管道從滾動中發現並精煉可重用技能。它提升了遊戲中長時程決策能力,適用於部分可觀測性和延遲獎勵環境。使用8B模型,在單人遊戲基準上比基準提升平均25.1%獎勵。

推出 HORIZON 基準測試,用以系統診斷 LLM 代理在跨領域長視野任務的失敗。評估 GPT-5 變體與 Claude 等 SOTA 模型,涵蓋 3100+ 軌跡,揭示退化模式。發布排行榜與經人類註解驗證(κ=0.84)的 LLM-as-a-Judge 流程。

Gemma 4 31B 在 FoodTruck Bench 取得第三名,超越 GLM 5、Qwen 3.5 397B 及所有 Claude Sonnets。它擅長長時程任務,並遵循自身規劃建議。發文者興奮但澄清非基準作者。

LifeBench 推出全新基準,用於評估 AI 代理的長期記憶,整合宣告式與非宣告式記憶類型,來自多樣數位痕跡。它利用社群調查與地圖 API 等真實世界先驗確保資料品質,並透過認知科學啟發的事件階層實現可擴展性。頂尖記憶系統僅達 55.2% 準確率,凸顯長視野擷取挑戰。

PseudoAct 是一個新框架,利用 LLM 生成偽代碼為代理建立結構化計劃,編碼迴圈、條件式和平行等控制流程。它克服 ReAct 在長時程任務的限制,減少多餘動作並確保一致執行。實驗顯示在 FEVER 上成功率提升 20.93%,並在 HotpotQA 創下新 SOTA。

Memory Bear AI 推出以記憶為中心的多模態情感智能框架,將情感視為結構化記憶系統中演化的變數。多模態訊號轉換為情感記憶單元 (EMUs),實現跨互動的持久儲存、檢索與更新。在噪音或缺失資料下,準確率與穩健性優於基準系統。