小米MiMo要接管桌面了

小米确认 MiMo 首款个人桌面应用近期上线,新一代模型同步训练。真正的看点不是多一个聊天窗口,而是 AI 能否串起办公软件、电脑文件与人车家设备。
小米 MiMo 要接管桌面了:首款个人应用即将上线
小米正在把 MiMo 从模型和编程工具,推向普通用户每天都要使用的电脑桌面。
8 月 18 日晚间,小米集团 CFO 林世伟在财报电话会上披露,MiMo 首款个人桌面端应用近期将上线,产品定位是帮助用户一站式完成办公与生活任务;与此同时,新一代 MiMo 模型正在训练中,有望很快发布。按照 2026 年 8 月 19 日这一时间点来看,这是小米首次明确释放 MiMo 面向个人桌面市场落地的信号。
MiMo 是小米面向推理、多模态与 Agent 任务打造的大模型及产品体系。 此前,外界对 MiMo 的认知主要集中在模型调用和 MiMo Code 等开发者工具上,而桌面应用意味着它将第一次以完整消费级产品的形式,直接进入用户的文件、软件和工作流。
这不是简单地给大模型套一个聊天窗口,而是小米试图让模型从回答问题,进一步变成可以执行任务的桌面 Agent。

已确认的信息不多,但方向已经非常清楚
小米目前确认了桌面应用、办公生活任务和新模型三件事,但尚未公布确切上线日期、支持系统与完整功能清单。
根据林世伟在财报电话会上的表述,MiMo 首款个人桌面端应用将在近期推出,并强调一站式完成办公生活任务。这里的关键词不是桌面端,而是一站式:如果它只是提供问答、写作和文件总结,那么与现有 AI 客户端没有本质区别;如果它能够调用本地文件、操作应用、管理日程并联动小米设备,产品逻辑才真正成立。
截至 8 月 19 日,小米尚未确认这款应用首发支持 Windows、macOS,还是优先适配小米自有电脑产品;也没有公布其是否能够直接控制 Office、WPS、浏览器、邮件客户端及系统文件。桌面应用是否收费、Token Plan 能否与个人客户端共享、是否支持第三方模型,同样没有获得官方确认。
因此,现阶段不应把第三方报道中出现的具体订阅价格、连续工具调用次数或 Token 节省比例,当成这款桌面应用的既定参数。能够确认的是,MiMo 已有模型商业化方案开始产生收入,但小米仍将 AI 视为投入期业务,短期目标不是依靠一款客户端快速变现,而是重构其人车家全生态。
桌面 Agent 与聊天机器人不是同一种产品
桌面 Agent 是能够读取计算机环境、调用工具并连续执行多步骤任务的 AI 应用。 普通聊天机器人通常在对话框里生成答案,而桌面 Agent 需要真正理解文件、应用状态和用户目标,再把一个任务拆成若干步骤执行。
例如,用户提出整理本周项目进度并安排评审会议,聊天机器人只能给出模板或建议;一个合格的桌面 Agent 则需要找到相关文档与聊天记录,提取进度和风险,生成汇报材料,检查参会人日历,再创建会议。任务链从一次文本生成,变成了搜索、读取、判断、写入和确认组成的连续操作。
桌面端也是 AI Agent 最有可能创造真实使用时长的入口。浏览器里的大模型知道用户主动上传了什么,却通常不了解电脑上有哪些文件、哪些窗口正在运行以及当前任务做到哪一步;桌面应用则天然靠近这些上下文,也更容易接入操作系统权限、文件索引、剪贴板、通知与快捷键。
小米的特殊筹码在于,桌面可能只是它的控制面板,而不是能力边界。纯软件公司可以连接第三方服务,小米则同时拥有手机、平板、电脑、汽车和大量智能家居设备。如果 MiMo 能获得跨设备授权,它处理的就不只是文档,还可能是把手机录音整理成纪要、将电脑路线同步到汽车、根据日程提前调整家庭设备状态。
不过,人车家联动目前仍是战略方向,不等于首个版本必然支持上述能力。首发产品究竟是通用聊天客户端、办公 Agent,还是小米设备的统一智能入口,需要等官方功能清单和实际演示才能判断。
MiMo Code 已经提前暴露了小米的 Agent 思路
MiMo Code 是小米 MiMo 团队基于 OpenCode 构建、采用 MIT 协议开源的终端编程 Agent。 它于今年 6 月 11 日发布 V0.1.0,重点并非只做代码补全,而是让模型在终端里持续规划、调用工具、修改项目并处理长程编程任务。
MiMo Code 对桌面应用最有参考价值的部分,是它把 Agent 的难题概括为计算、记忆和进化。模型单次回答是否聪明,只解决了计算问题;任务执行到几十步甚至数百步后,如何保存状态、召回早期约束并避免重复犯错,才决定 Agent 能不能真正干活。
长任务不能仅靠不断拉长上下文窗口解决。MiMo Code 官方介绍显示,其 MiMo Auto 模式基于 MiMo-V2.5,可支持 100 万 Token 上下文,但长上下文仍会被工具输出、代码片段与报错日志填满;即使容量没有耗尽,关键约束也可能被大量信息稀释,导致模型在后半程偏离目标。
MiMo Code 因此引入了显式的存储与检索机制,决定哪些信息需要写入持久结构,以及何时重新召回。小米公布的内部测评结果显示,当任务执行步数不超过 200 步时,MiMo Code 与对照方案的胜率接近 50%;当步数超过 200 步并包含多轮用户交互后,MiMo Code 的胜率升至 65% 以上。
这套技术路线很可能成为桌面应用的底层经验,而不是直接照搬的产品形态。编程 Agent 面对的是代码仓库、终端命令和测试结果,桌面 Agent 面对的则是格式各异的文档、权限复杂的应用以及更模糊的自然语言指令,后者的任务边界更宽,误操作成本也更高。
MiMo-V2.5 的调用量成绩,证明了效率但没有证明产品体验
MiMo-V2.5 在模型市场获得了可观的开发者使用量,但调用量第一不能直接等同于综合能力第一。
林世伟表示,MiMo V2.5 在今年 7 月拿下 OpenRouter 月调用量和周调用量第一,原因是模型能力、推理效率与成本控制形成了系统性优势。OpenRouter 聚合了大量模型及开发者调用,其流量排名能够反映模型的实际采用程度,但也会受到价格、免费活动、默认路由和特定应用流量的影响。
MiMo 当前公开的模型体系已经覆盖文本、语音识别与语音合成。官方 Token Plan 文档列出的 6 款模型包括 mimo-v2.5-pro、mimo-v2.5、mimo-v2.5-asr、mimo-v2.5-tts-voiceclone、mimo-v2.5-tts-voicedesign 和 mimo-v2.5-tts;旧版 MiMo-V2 系列已于 2026 年 6 月 30 日下线,原模型名称失效。
MiMo-V2.5 和 MiMo-V2.5-Pro 默认开启深度思考模式,适用于复杂推理、代码生成与多步骤分析。对于桌面 Agent 而言,多步骤决策能力比单轮文案质量更加关键,因为模型不仅要生成内容,还要决定下一步调用什么工具、何时停止,以及哪些操作必须先获得用户确认。
| 项目 | MiMo-V2.5 | MiMo-V2.5-Pro | 对桌面应用的潜在意义 | |---|---|---|---| | 产品定位 | 强调效率与日常任务覆盖 | 面向更复杂推理和 Agent 任务 | 可按任务难度自动选择模型 | | 深度思考 | 默认开启 | 默认开启 | 有利于多步骤规划,但可能增加等待时间 | | 多模态相关能力 | MiMo 体系包含语音模型 | 更偏复杂任务执行 | 可覆盖录音、会议和语音交互场景 | | 长程任务基础 | 可用于 MiMo Code | 更适合高复杂度工作流 | 决定桌面 Agent 能否持续执行任务 | | 当前确定状态 | 已投入实际使用 | 已进入现有模型体系 | 新一代模型仍在训练,名称尚未公布 |
新一代 MiMo 模型与桌面应用同时被提及,说明小米可能在做模型和产品的协同发布。桌面 Agent 对模型的要求与普通聊天不同,它既需要更低延迟和更低成本,也需要稳定的工具调用、视觉理解、状态记忆与长程指令遵循;如果只提高跑分而不改善执行稳定性,桌面应用仍然很难跨过演示与日用之间的鸿沟。
与 ChatGPT、豆包等桌面产品相比,小米的优势不在聊天
小米进入桌面 AI 市场的时间并不早,但它拥有其他模型公司难以复制的硬件覆盖面。
| 产品方向 | 核心入口 | 主要优势 | 主要挑战 | |---|---|---|---| | 小米 MiMo 桌面应用 | 电脑与小米人车家设备 | 跨设备协同、硬件生态、模型成本控制 | 首版功能未知,桌面软件生态仍需建立 | | ChatGPT 桌面端 | OpenAI 模型与通用工具 | 模型能力、产品成熟度、全球开发者生态 | 对中国本地软件和硬件环境覆盖有限 | | 豆包桌面端 | 字节系内容与消费产品 | 中文交互、内容生态、用户规模 | 深层系统操作与跨品牌设备协同仍受权限限制 | | 传统办公 AI 助手 | 文档、表格、演示软件 | 与办公格式结合紧密,部署路径清晰 | 往往被限制在单一软件,跨应用任务能力不足 |
MiMo 最值得观察的差异化不是写文章和做摘要,而是能否把桌面任务与小米设备状态连接起来。聊天和写作能力已经高度同质化,用户不会仅仅因为多一个模型客户端就迁移;但如果 MiMo 能安全地完成电脑、手机、汽车与家庭设备之间的连续任务,它就可能获得系统级入口价值。
小米面临的短板同样直接:电脑操作系统和主流办公软件并不由它控制。Windows、macOS、WPS、Office、浏览器与企业协作平台各有权限体系,真正可靠的自动化不能只靠模拟点击,还需要稳定的工具协议、插件生态和应用合作。
真正决定产品成败的是权限、安全和可恢复性
桌面 Agent 的第一道门槛不是模型智商,而是用户是否敢把文件和操作权限交给它。
一个可以读取本地文件、发送邮件、修改日程和控制设备的 AI,一旦理解错误,后果比生成一段错误答案严重得多。删除文件、覆盖表格、把内部文档发送给错误联系人,或者在用户不知情时持续读取屏幕,都会迅速摧毁信任。
MiMo 桌面应用至少需要提供四类安全机制:清晰的权限分级、敏感操作二次确认、完整操作日志,以及可撤销或可恢复能力。理想状态下,读取文件、修改文件、对外发送和控制设备应当是不同级别的授权,用户还应能够把权限限制在某个文件夹、某段时间或某个具体任务中。
本地处理比例也会成为深度用户关注的指标。小米尚未说明桌面应用有哪些任务可在设备本地完成、哪些内容需要上传至云端,也未公布企业数据隔离和保留策略;在这些问题得到明确回答前,它更适合个人尝鲜,不宜被提前视为成熟的企业自动化平台。
Token Plan 已有收入,但桌面端商业模式仍未落定
Token Plan 是小米面向 AI 编程和模型使用场景提供的订阅资源方案。 林世伟透露,这项业务已经开始贡献收入且增速较快,但小米 AI 业务仍处于大规模投入期,暂时不以变现为主要目的。
这一表态意味着桌面应用早期可能更重视用户规模、使用频率和生态协同,而不是立即追求高订阅收入。对于小米而言,AI 如果能提高手机、电脑、汽车与智能家居的黏性,其价值未必完全体现在单独的软件收入上。
Token Plan 是否会成为桌面应用的计费基础,目前没有官方结论。用户需要重点关注三个问题:现有订阅额度能否跨 MiMo Code 和桌面应用共享、复杂任务是否按模型用量额外消耗资源,以及语音、多模态和设备控制是否属于独立权益。
现在值得期待,但还不到下结论的时候
MiMo 桌面应用值得小米生态用户和 Agent 开发者重点关注,但真正的判断必须等到产品可下载、可测试之后。
首发评测最应该观察的不是回答文案是否漂亮,而是连续任务完成率、平均操作步骤、人工接管次数和失败后的恢复能力。一个任务执行到第 20 步才出错,往往比第一步就拒绝执行更浪费时间;Agent 产品需要用完整任务成功率衡量,而不是只看单轮模型跑分。
小米这次释放的信号已经足够明确:MiMo 不再满足于停留在模型服务和终端编程助手,而要进入个人计算的主界面。它的上限是成为连接电脑、手机、汽车和家庭设备的统一智能入口,下限则是又一个带文件上传功能的聊天客户端。
两者之间的差距,不取决于发布会演示能完成多少任务,而取决于普通用户连续使用一周后,是否愿意继续把真实工作交给它。
参考来源
- IT之家:小米 CFO 林世伟称 MiMo 首款个人桌面应用即将上线 —— 披露财报电话会信息,包括桌面应用、新一代模型、Token Plan 收入及 OpenRouter 调用量表现。



