
MobileMem 將長期記憶帶入行動 AI
MobileMem 是一套評估個人 AI 助理裝置端長期記憶的基準測試與框架,使用長達一年的行動體驗資料。它透過文字與多模態設定,測試代理在時間推理、知識更新、多跳回憶及隱含偏好推論方面的能力。
Tag: #long-term-memory7 results

MobileMem 是一套評估個人 AI 助理裝置端長期記憶的基準測試與框架,使用長達一年的行動體驗資料。它透過文字與多模態設定,測試代理在時間推理、知識更新、多跳回憶及隱含偏好推論方面的能力。

華為諾亞實驗室開源了專為 AI Agent 設計的記憶操作層 MindMemOS。該系統支援 AI Agent 在技能演進的同時,實現可遷移且具備自我進化能力的記憶管理。

WorldLines 是一個旨在評估具身智能體在長期記憶與居家任務規劃能力的新基準。它引入了 ObsMem 框架,以解決複雜且長期的互動中,部分可觀測性與狀態追蹤的挑戰。

文章報導,DeepSeek Harness 外掛在 GitHub 上迅速受到關注。社群打造的擴充功能據稱包括長期記憶、電子寵物,以及 4399 類型的瀏覽器小遊戲。
中國首批人工智慧終端智能化分級測試共有 11 款行動終端達到 L3,包括 9 部手機與 2 台平板。這套自願性的指導標準評估的是終端端到端能力,而不只是模型品質;L3 代表輔助式任務執行,L4 的要求則仍未確定。

VehicleMemBench 推出車內 AI 代理多用戶長期記憶的可執行基準測試,使用模擬環境透過後續動作狀態比對評估工具使用與記憶。解決現有單用戶基準的不足,模擬偏好動態變化與用戶間衝突。每樣本包含 23 個工具與 80+ 歷史事件,資料集已釋出供研究使用。
這篇arXiv論文提出「先儲存後依需求提取」的AI記憶方法,以保留原始經驗並避免當前主流「提取後儲存」方法的資訊遺失。它還探討從機率經驗集合中發掘更深層洞見,以及透過共享儲存提升效率。簡單實驗驗證這些概念,並概述挑戰與研究方向。