
MobileMem 將長期記憶帶入行動 AI
MobileMem 是一套評估個人 AI 助理裝置端長期記憶的基準測試與框架,使用長達一年的行動體驗資料。它透過文字與多模態設定,測試代理在時間推理、知識更新、多跳回憶及隱含偏好推論方面的能力。
Tag: #mobile-agents9 results

MobileMem 是一套評估個人 AI 助理裝置端長期記憶的基準測試與框架,使用長達一年的行動體驗資料。它透過文字與多模態設定,測試代理在時間推理、知識更新、多跳回憶及隱含偏好推論方面的能力。

Gemini 在 Android 手機上獲得重大代理升級,能處理跨應用程式的多步驟任務。此更新驅動新功能,並提供推出時程細節。

MobiFlow 是用於任意第三方應用程式任務的行動代理全新評估框架。它採用基於多軌跡融合的圖形建構演算法,有效壓縮狀態空間並支援動態互動。涵蓋 20 款應用程式與 240 項任務,比 AndroidWorld 更符合人類評估。

ProactiveMobile 推出用於 MLLMs 行動代理主動智能的基準,解決自主預測需求評估工具缺乏問題。包含 3,660 個實例、14 個真實情境、多答案註解及專家審核,並有 63 個 API。微調 Qwen2.5-VL-7B-Instruct 達 19.15% 成功率,勝過 o1 及 GPT-5。
中國首批人工智慧終端智能化分級測試共有 11 款行動終端達到 L3,包括 9 部手機與 2 台平板。這套自願性的指導標準評估的是終端端到端能力,而不只是模型品質;L3 代表輔助式任務執行,L4 的要求則仍未確定。

Anthropic 正在 Claude iOS 應用程式中測試受管理的 24/7 代理。這指向行動裝置與網頁功能的統一。持久 AI 代理即將提供給使用者。

Google 和 Samsung 的 Gemini 在 S26 Ultra 上推出任務自動化 Beta 版,能透過簡單提示處理外送和叫車訂單。AI 在虛擬視窗中自主操作應用程式。這實現了長久以來 AI 助理的期待功能。
文章預測移動端 AI Agent 即將爆發式發展。ColorOS 作為先驅範例。安卓權限開放與端側模型將推動 GUI Agent 前進。
Framework anonymizes sensitive UI data with type-preserving placeholders for cloud-based GUI agents. Detects PII across screenshots, XML, and instructions via layered architecture. Achieves top privacy-utility trade-off on benchmarks.