AI 快讯MobileMem来了,AI手机开始考记忆
行业快讯

MobileMem来了,AI手机开始考记忆

2026-09-02T04:03:45.205Z
MobileMem来了,AI手机开始考记忆

OPPO 联合 OpenKG、浙江大学、同济大学、东南大学等团队发布端侧 AI 记忆评测基准 MobileMem,试图用统一标准衡量 AI 手机能否长期记住、更新并正确使用用户信息。

MobileMem来了,AI手机开始考记忆

端侧 AI 记忆评测基准 MobileMem 于 2026 年 9 月 2 日发布,OPPO 联合 OpenKG、浙江大学、同济大学、东南大学等团队,试图为 AI 手机的长期记忆能力建立一套统一测试标准。

这件事的意义不在于又发布了一个模型榜单,而在于 AI 手机终于开始面对一个比“能不能聊天”更难、也更接近真实使用的问题:它能不能在几天、几周甚至更长时间里,持续理解同一个用户,并在合适的时机调用过去的信息?

过去两年,手机厂商竞相把大模型塞进系统助手、相册、通话、输入法和办公应用里。语音问答、图片总结、会议纪要已经不算新鲜能力,但这些功能大多仍然是一次性任务:用户提问,模型回答;用户上传文件,模型处理。真正的个性化助手必须具备长期记忆,即持续积累、检索、更新并推理用户信息的能力。

刘作虎在今日的公开表态中,将 AI 手机的发展阶段概括为从“你问一句、它答一句”,走向“真正懂你、能够主动服务你”。MobileMem 正是围绕这条路线出现的基础设施型项目。

AI 手机长期记忆工作流示意图,展示用户行为、记忆存储、检索、推理与任务执行之间的关系

AI 手机过去缺的不是聊天能力,而是连续性

聊天能力解决的是单轮交互问题,长期记忆解决的是跨时间的连续交互问题。

举个简单例子:用户第一次告诉助手自己下个月要去东京出差,随后在几天内搜索了机场交通、收藏了几家餐厅,又在聊天中提到自己不吃生鱼。一个真正有用的手机智能体,不应该只在被问到时复述“你要去东京”,而应该能够在用户查看行程、预订餐厅或规划路线时,把这些分散信息组合起来,主动规避冲突并给出建议。

这类任务的难点不在于模型是否知道东京有哪些餐厅,而在于它能否完成四步工作:

  1. 识别哪些信息值得记住。 用户说过的每句话都保存,会迅速造成噪声、隐私风险和存储压力。
  2. 在合适的时间找回正确记忆。 相关信息可能来自数天前的聊天、应用操作、图片或日历事件。
  3. 理解记忆之间的时间关系。 用户的偏好会变化,临时安排也可能覆盖旧计划。
  4. 把记忆用于实际任务。 找到信息并不等于会使用,系统还要在回答、搜索或执行操作时正确引用它。

传统问答数据集通常关注一个问题对应一个答案,评测的是模型能否从上下文中找出事实。MobileMem 评测的则是长期、多模态、动态变化的用户记忆,核心单位不是孤立事实,而是持续演化的用户经历。

这意味着,AI 手机的“记忆”不应被理解成简单的聊天记录搜索。它更像一个不断更新的个人知识库:既保存事实,也保存时间、来源、上下文和置信度,还要知道哪些偏好是长期稳定的,哪些只是用户某一天的临时选择。

MobileMem具体测什么

MobileMem 是面向移动端 AI 助手长期记忆能力的统一评测基准,而不是一个独立的记忆系统。

根据公开论文信息,MobileMem 以长时间跨度的移动使用经历为基础,通过知识约束的合成流程,构建连贯且具有时间一致性的用户轨迹。它并非简单把大量聊天记录拼接在一起,而是试图还原用户在多个应用、多个时间点上的连续行为。

目前披露的评测设计覆盖文本和多模态两种场景,重点关注以下几类能力:

| 评测维度 | 主要考察内容 | 现实中的典型场景 | |---|---|---| | 任务理解 | 能否理解用户当前要完成的目标及隐含条件 | 根据行程、预算和饮食偏好规划晚餐 | | 记忆检索 | 能否从长期经历中找到相关信息 | 找回用户上周收藏过的酒店和评价 | | 多跳推理 | 能否连接多个时间点或多个来源的信息 | 将会议安排、出差地点和交通习惯结合起来 | | 时间推理 | 能否区分过去、当前和未来计划 | 判断旧行程是否已经取消,避免引用过期信息 | | 知识更新 | 能否用新信息修正旧记忆 | 用户从“喜欢咖啡”变成“近期戒咖啡” | | 隐式偏好推断 | 能否从行为而非明确表述中发现偏好 | 从多次选择推断用户偏好的价格区间 | | 多模态记忆 | 能否理解图片、文本等不同形式的信息 | 从截图、相册和聊天内容中还原购物线索 | | 安全与执行衔接 | 能否在使用记忆时控制风险并正确行动 | 涉及支付、位置或隐私操作时请求确认 |

MobileMem 的关键价值,是把“记住了多少”升级为“能否在变化的上下文中正确使用记忆”。

这一区别非常重要。一个系统可以在记忆召回率上表现很好,却把三个月前的临时偏好当成永久习惯;也可以准确找回用户曾经说过的话,却无法判断这句话是否已经被新信息覆盖。对于 AI 手机来说,后者比“没搜到”更危险,因为它会制造一种看似个性化、实际错误的主动服务。

它不是手机端跑分,也不是单纯的 RAG 榜单

MobileMem 评测的是端侧智能体的记忆链路,不等同于芯片性能、模型参数量或单次检索速度测试。

端侧 AI 记忆往往包含多个模块:任务理解、记忆写入、向量或结构化检索、重排序、上下文拼接、模型推理、联网搜索、安全判断以及最终执行。MobileMem 采用模块化设计,可以接入不同的 Agent 和端侧智能体,让研究者分别优化记忆检索算法、检索增强生成流程和任务执行模块。

这也解释了为什么它比传统 RAG 评测更接近手机真实体验。传统 RAG 通常从一个固定知识库中检索与问题相关的片段,知识本身不会频繁变化;手机助手面对的是一个持续流动的个人数据环境,来源包括聊天、日历、相册、地图、浏览记录和应用操作,而且这些数据的可信度、时效性和敏感程度各不相同。

对端侧 Agent 来说,最难的不是把更多内容塞进上下文,而是在有限资源下决定什么该留下、什么该更新、什么只能临时使用。

从工程角度看,MobileMem 至少会推动行业重新讨论三个问题:

  • 记忆写入策略: 是让模型自动记录,还是由规则、分类器和用户确认共同决定?
  • 记忆生命周期: 一条信息应该保存多久,过期后是删除、降权,还是保留为历史记录?
  • 记忆可解释性: 当助手给出个性化建议时,用户能否看到它依据了哪些信息,并纠正错误?

这些问题目前没有一个适用于所有产品的答案,但没有统一基准,厂商也很难知道自己的方案到底改进了什么。MobileMem 的出现,至少为“记忆能力”从产品宣传语变成可比较的技术指标提供了入口。

对开发者来说,真正值得关注的是评测口径

MobileMem 最值得关注的不是一个总分,而是它能否让开发者定位长期记忆系统的具体短板。

如果一个手机助手在单轮问答中表现很好,但在多跳推理和知识更新上得分低,问题可能不在基础模型,而在记忆抽取、时间标注或检索排序。如果多模态任务明显落后于纯文本任务,短板可能来自图片信息结构化,而不是模型不会推理。

这种拆分对端侧系统尤其重要。由于手机受到存储空间、内存、功耗、散热和隐私限制,开发者通常不能简单地换一个更大的模型来解决问题。更现实的做法是把不同模块分层:

  • 用轻量模型或规则负责事件抽取和敏感信息识别;
  • 用结构化数据保存时间、地点、人物和任务状态;
  • 用向量检索处理语义相似内容;
  • 用重排序模型判断当前问题与历史记忆的真实相关性;
  • 只在必要时调用更强的本地模型或云端模型;
  • 在执行高风险操作前增加确认和可撤销机制。

统一基准能够帮助开发者比较“更大的模型”和“更好的记忆架构”分别带来了多少收益。

从产品角度看,厂商也需要避免把记忆能力包装成模糊的“懂你”。用户真正关心的是:助手是否记错过、是否会擅自使用隐私信息、是否能删除一条错误记忆、是否会把家庭成员的信息混在一起,以及换机后记忆如何迁移。一个分数高但无法解释和纠错的系统,未必是好产品。

端侧部署的优势与代价

端侧记忆的核心优势是数据可以尽量留在设备上,但“在本地”并不自动等于“绝对安全”。

手机是最接近个人生活的数据入口,端侧处理能够减少聊天记录、位置、相册、健康和日程信息离开设备的频率,也能在弱网或无网环境下维持部分个性化能力。对于需要低延迟响应的系统助手,本地检索还可以避免每次都把完整历史上传服务器。

但端侧部署也带来另一组现实约束。设备上的记忆数据库可能成为高价值攻击目标;不同应用的数据权限边界很难设计;本地模型能力有限时,系统可能需要把部分任务交给云端;当用户更换设备、恢复备份或与家人共享设备时,记忆的迁移和隔离同样复杂。

端侧 AI 记忆的安全边界,应该同时覆盖数据采集、记忆生成、检索调用、模型输出和动作执行五个环节。

MobileMem 目前更像能力评测的起点,而不是完整的隐私认证标准。行业还需要补充数据脱敏、记忆删除、权限审计、越权检索、提示注入和跨应用隔离等测试。尤其当智能体能够代替用户打开应用、发送消息或完成交易时,记忆错误可能从“回答不准确”升级为现实世界的操作风险。

OPPO接下来会把它落到什么产品里

MobileMem 的发布与 OPPO 即将到来的 ColorOS 17 形成了明确的产品时间线。

OPPO ColorOS 17 发布暨开发者大会将于 2026 年 9 月 17 日 10:00 在广东珠海举行,主论坛预计发布全新 ColorOS 17。考虑到 OPPO 此次将端侧 AI 记忆定义为 AIOS 的基础能力,外界自然会关注 MobileMem 是否会进一步落到系统级智能体、跨应用协同、个人知识管理和主动服务等功能中。

不过,评测基准发布与产品能力落地之间仍然隔着一段距离。

一个研究基准可以证明系统能否在标准任务上检索和推理,但真实手机还要处理权限弹窗、应用接口不统一、后台运行限制、系统升级、用户误操作和家庭成员共用设备等问题。更重要的是,主动服务必须掌握分寸:提醒太少,用户觉得它不够聪明;提醒太多,用户会迅速关闭相关功能。

OPPO 如果希望把 MobileMem 转化为产品优势,需要在 ColorOS 17 中回答几个具体问题:记忆是否默认开启、用户能否逐条查看和删除、敏感信息是否单独授权、端侧与云端如何分工、记忆错误是否支持一键纠正,以及不同应用之间的记忆共享边界由谁控制。

这些体验细节,最终会比发布会上“AI 更懂你”的口号更能决定用户是否愿意长期使用。

行业影响:AI 手机竞争将从模型接入转向个人数据组织

MobileMem 释放的行业信号是,AI 手机的竞争重点正在从“接入哪个大模型”转向“如何组织和使用个人上下文”。

当基础模型的通用对话能力逐渐趋同,厂商的差异化不再只来自参数规模或榜单成绩,而来自系统能否把碎片化的个人数据变成可靠、可控、可更新的上下文。谁能更好地管理用户的长期目标、习惯、关系和任务状态,谁就更可能成为手机智能体的入口。

但这条路线也意味着,手机厂商不能只做一个更会聊天的助手,而要建设一套完整的记忆基础设施:数据接入标准、事件抽取、时序知识管理、跨应用权限、端云协同、隐私保护和评测体系缺一不可。MobileMem 先解决了“怎么测”的问题,接下来行业还要解决“怎么存、怎么管、怎么删、怎么用”。

如果说上一阶段 AI 手机比的是模型能否回答问题,那么下一阶段比的将是系统能否在不打扰用户的前提下,持续、准确且安全地记住重要事情。

目前 MobileMem 技术白皮书已经公开,数据集和相关工具将陆续开源。对于研究者和开发者而言,接下来最值得观察的不是某家厂商是否率先宣布“记忆功能”,而是不同方案在时间推理、偏好更新、多模态记忆和安全控制上的真实差距。

AI 手机终于开始面对“记忆”这门基础课。MobileMem 未必能立即解决端侧智能体的所有问题,但它至少把行业从概念宣传拉回到了一张更具体的考卷上:记住什么、何时想起、如何更新,以及在什么情况下不该使用。

参考来源

  1. IT之家:手机 AI 谁更强,OPPO 联合多所高校推出端侧 AI 记忆评测基准 MobileMem —— 介绍 MobileMem 发布背景、合作团队及 OPPO 方面的公开表态。
  2. IT之家:OPPO ColorOS 17 发布暨开发者大会信息 —— 提供 ColorOS 17 发布暨开发者大会的相关时效信息。

注:本文关于 MobileMem 的评测范围、长期移动使用轨迹、多模态设置和模块化框架,依据项目公开论文摘要与发布信息整理;具体数据集规模、评分细则和开源进度,以项目后续正式发布内容为准。

相关推荐

查看全部