📄ArXiv AI•較早收集於 22h
ProactiveMobile:行動裝置主動智能全面基準

#mobile-agents#mllm-benchmarksproactivemobileproactivemobileqwen2.5-vl-7b-instructo1gpt-5
💡新基準顯示 MLLMs 主動性不足;Qwen 達 19% 勝 o1/GPT-5(67字)
⚡ 30-Second TL;DR
有什麼變化
新基準包含 3,660 個 14 真實行動情境實例
為什麼重要
此基準揭露當前 MLLMs 主動性缺口,推動自主行動代理開發。提供標準化、可執行評估,助超越反應式範式。
下一步行動
從 arXiv:2602.21858 下載 ProactiveMobile,並評估您的 MLLM 主動任務表現。
誰應關注:Researchers & Academics
關鍵要點
- •新基準包含 3,660 個 14 真實行動情境實例
- •從 4 種裝置訊號推斷意圖,生成 63 API 序列
- •30 位專家審核準確性與可行性
- •微調 Qwen2.5-VL-7B-Instruct:19.15% 成功率,勝 o1 (15.71%) 及 GPT-5 (7.39%)
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
📊 競品分析▸ Show
| 基準 | 平台 | 實例數 | 情境數 | 專家審核 | 成功率 (微調模型) | 脈絡維度 |
|---|---|---|---|---|---|---|
| ProactiveMobile | 行動裝置 | 3,660+ | 14 | 30 位 | 19.15% (Qwen2.5-VL-7B) | 4 |
| ProAgentBench [5] | 工作情境 (PC) | 28,000+ | 未指定 | 未指定 | 未提供基準比較 | 階層任務 (時機+內容) |
🛠️ 技術深入
- •任務形式化:代理需從四維脈絡訊號(使用者檔案、裝置狀態、世界資訊、行為軌跡)推斷意圖,並生成 63 個 API 的可執行函數序列[1][2][3]。
- •資料集細節:訓練集 4,438 文字實例(8,259 tokens,平均 1.86),測試集 1,832 多模態實例(3,711 答案,14,341 API 呼叫,平均 7.83)[2]。
- •評估指標:成功率 (SR) 衡量功能正確性,微調 Qwen2.5-VL-7B-Instruct 使用專屬 Proactive 模型達 19.15%[1][2][3]。
- •品質控制:30 位專家審核事實準確性、邏輯一致性及動作可行性,並修正不合規項目[1][3]。
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
2026-02-25
ProactiveMobile 論文發布於 arXiv (2602.21858v1)
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。