Search

Tag: #long-horizon8 results

MiRA 強化開源 LLM 代理超越 GPT-4

MiRA 強化開源 LLM 代理超越 GPT-4

研究人員提出子目標驅動框架與 MiRA RL 方法,解決 LLM 代理在網頁導航的長時程規劃問題。MiRA 將 Gemma3-12B 在 WebArena-Lite 的成功率從 6.4% 提升至 43%,超越 GPT-4-Turbo (17.6%) 與 GPT-4o (13.9%)。此規劃與里程碑獎勵組合提升自主 AI 能力。

ResearchGym:AI代理真實研究評估基準

ResearchGym:AI代理真實研究評估基準

ResearchGym 推出一個基準,包含來自 ICML、ICLR 和 ACL 論文的五個容器化環境,總共 39 個子任務,代理需提出假設並執行實驗以超越基準。GPT-5 驅動的代理顯示能力-可靠性差距,仅在 6.7% 的評估中成功,並平均完成 26.5% 的子任務。它識別關鍵失敗模式,如不耐煩和資源管理不善,偶爾不可靠地達成 SOTA 成果。

ArXiv AIResearchFeb 18#ai-agents#benchmark#long-horizon
COSPLAY:共同演化LLM代理用於長時程任務

COSPLAY:共同演化LLM代理用於長時程任務

COSPLAY是一個共同演化框架,其中LLM決策代理從可學習技能庫檢索技能來引導行動,同時技能管道從滾動中發現並精煉可重用技能。它提升了遊戲中長時程決策能力,適用於部分可觀測性和延遲獎勵環境。使用8B模型,在單人遊戲基準上比基準提升平均25.1%獎勵。

ArXiv AIResearchApr 24#co-evolution#skill-bank#long-horizon
LifeBench:長視野多源記憶基準

LifeBench:長視野多源記憶基準

LifeBench 推出全新基準,用於評估 AI 代理的長期記憶,整合宣告式與非宣告式記憶類型,來自多樣數位痕跡。它利用社群調查與地圖 API 等真實世界先驗確保資料品質,並透過認知科學啟發的事件階層實現可擴展性。頂尖記憶系統僅達 55.2% 準確率,凸顯長視野擷取挑戰。