MobileMem:面向移动端长时记忆的智能体基准框架
研究团队发布 MobileMem 基准与框架,基于一年期移动端真实使用数据,评估设备端智能体的长时记忆与持续学习能力。
AI 智能体正从「单轮问答」向「持续陪伴的个人助理」演进,这类系统需要长期记忆来不断积累和调用用户特有的经验。然而,现有的智能体记忆基准大多面向孤立事实的检索,难以反映真实移动场景中数据的多模态、异构、时变和高度个性化特征。为此,研究团队在 arXiv 上发表了论文 MobileMem,提出一个面向设备端长时记忆研究的基准与框架,填补了该领域的空白。
研究背景:从信息检索到体验智能
传统 RAG 或记忆系统通常把「记忆」理解为对静态事实的检索与召回,但真实用户与手机的交互远不止于此:聊天记录、相册、应用行为、偏好变化等共同构成一段连续、可追溯的「体验」。MobileMem 的核心思路是:与其让智能体记住零散的事实,不如让其在长时序、多模态的轨迹上学习如何理解过去、把握当下、适应未来,从而实现作者所称的「体验智能」(experiential intelligence)。
MobileMem 的核心设计
MobileMem 基于一年规模(year-scale)的真实移动端使用数据构建,并通过一条「知识驱动的合成流水线」,从用户与应用的多轮 session 中生成在时间上一致、语义上连贯的长时序轨迹。这一设计绕过了直接采集隐私敏感原始数据的限制,同时保留了体验的连续性和多样性。
该框架同时提供两种互补的设置:
- 文本设置:覆盖多跳推理、时序推理等纯语言任务;
- 多模态设置:结合图像、界面、语音等多模态信息,测试更接近真实使用场景的记忆与推理能力。
任务维度:记住过去、理解当下、面向未来
MobileMem 设置了四类核心评测任务:
- 多跳推理:要求智能体跨多个历史 session 串联信息作答;
- 时序推理:测试对事件先后关系和时间间隔的判断;
- 知识更新:考察智能体在新事实出现后,是否能正确更新而非遗忘旧记忆;
- 隐式偏好推断:从历史交互中挖掘未被显式表达的个性化偏好。
通过这四类任务,MobileMem 试图把「记忆」的评估从「能不能查到」推进到「能不能理解、能不能适应」。
研究意义与未来方向
MobileMem 的提出,为评估和训练具备持续学习能力的移动端个人助理提供了一个标准化平台。其重要性体现在两点:一是把「长时序、多模态、个性化」同时纳入评测,更贴合真实场景;二是以「体验」而非「事实」为建模对象,推动记忆研究从检索范式向持续学习范式转变。对于正在布局端侧大模型和智能体产品的厂商而言,这类基准也将成为衡量 on-device agent 实际可用性的重要参考。
