📄ArXiv AI•較早收集於 17h
MiRA 強化開源 LLM 代理超越 GPT-4

💡開源模型 WebArena 達 43% SR,擊敗 GPT-4o 3 倍—代理新 SOTA!
⚡ 30-Second TL;DR
有什麼變化
子目標分解實現如 Gemini 等專有 LLM 的自適應線上規劃(+10% SR)。
為什麼重要
開源模型在代理基準上匹敵或超越專有模型,民主化先進自主性。實現如瀏覽器與 OS 等真實數位環境的可擴展 RL。
下一步行動
使用 WebArena-Lite 在 Gemma3-12B 上重現 MiRA 以微調您的網頁代理。
誰應關注:Researchers & Academics
關鍵要點
- •子目標分解實現如 Gemini 等專有 LLM 的自適應線上規劃(+10% SR)。
- •MiRA 使用密集里程碑基礎獎勵,提升稀疏任務的 RL 微調效果。
- •Gemma3-12B 在 WebArena-Lite 躍升至 43% SR,擊敗 GPT-4o 與先前 SOTA WebRL (38.4%)。
- •解決長時程網頁任務中的線上執行漂移與 RL 信用分配問題。
🧠 深度解析
本篇為 AI 生成分析,非原文內容。
🔑 增強重點摘要
- •MiRA 框架引入了動態規劃調整機制,允許代理在執行過程中根據網頁狀態變化即時修正子目標,而非僅依賴預先定義的靜態路徑。
- •該研究證實了透過強化學習(RL)對中小型參數模型(如 Gemma3-12B)進行針對性訓練,在特定領域(如網頁自動化)的效能可顯著優於通用型超大規模模型。
- •MiRA 解決了長時程任務中的『獎勵稀疏性』問題,透過將複雜任務分解為多個可驗證的里程碑,顯著降低了 RL 訓練過程中的探索難度與計算成本。
📊 競品分析▸ Show
| 特性/模型 | MiRA (Gemma3-12B) | WebRL | GPT-4o | GPT-4-Turbo |
|---|---|---|---|---|
| 核心架構 | 子目標驅動 RL | 傳統 RL 微調 | 通用多模態 | 通用多模態 |
| WebArena-Lite 成功率 | 43% | 38.4% | 13.9% | 17.6% |
| 部署成本 | 低 (12B 模型) | 中 | 高 (API 呼叫) | 高 (API 呼叫) |
| 線上規劃能力 | 自適應動態規劃 | 有限 | 靜態提示詞規劃 | 靜態提示詞規劃 |
🛠️ 技術深入
- 子目標分解機制:採用層次化規劃器,將高階任務目標拆解為一系列可執行的原子操作序列,並透過狀態機監控執行進度。
- 密集里程碑獎勵函數:設計了一種基於網頁 DOM 樹變化的獎勵計算方法,當代理成功觸發關鍵 UI 元素或完成特定頁面狀態轉換時,給予即時正向回饋。
- 線上執行漂移修正:引入了回溯機制,當代理偵測到當前網頁狀態與預期子目標不符時,會觸發重新規劃模組以修正執行路徑。
- RL 微調策略:基於近端策略優化 (PPO) 演算法,結合了離線預訓練與線上環境互動,以確保模型在保持通用能力的同時,強化網頁導航的專精能力。
🔮 前景展望AI analysis grounded in cited sources
開源模型將在特定垂直領域自動化任務中取代通用閉源模型。
MiRA 的成功證明了針對特定任務優化的中小型模型在效能與成本效益上具有顯著優勢。
網頁代理的開發將從單純的提示詞工程轉向基於環境回饋的強化學習框架。
研究顯示僅靠提示詞無法解決長時程任務中的漂移問題,必須引入動態規劃與獎勵機制。
⏳ 時間線
2025-11
Gemma 3 系列模型發布,為輕量化高效能代理提供基礎架構。
2026-01
研究團隊開始針對 WebArena-Lite 基準測試進行長時程規劃問題的初步實驗。
2026-03
MiRA 框架正式發表,展示了在 WebArena-Lite 上超越 GPT-4 系列的效能數據。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。