AI 快讯小米MiMo v2.6,押注强化学习
模型上新

小米MiMo v2.6,押注强化学习

2026-09-21T22:07:10.025Z
小米MiMo v2.6,押注强化学习

小米 MiMo 系列迎来 v2.6 更新,重点转向可扩展强化学习。新版本披露了单步 20 亿 Token、1568 路 Prompt 并行、异步训练和 GraderCompute 等技术进展,但目前更像一次训练基础设施与模型能力升级,尚不能简单视为 v2.5 的线上替代品。

小米 MiMo v2.6,押注强化学习

小米 MiMo 团队近日发布 MiMo v2.6,核心变化不是再堆一个更大的参数规模,而是把重点放在强化学习的可扩展性、异步训练和奖励评估系统上。

从目前公开信息看,MiMo v2.6 的单步处理规模达到 20 亿 Token,可同时支持 1568 个 Prompt 生成;训练系统采用完全异步架构,并引入面向评分过程的 GraderCompute 模块。小米还披露,相关项目累计投入已经超过 125 万美元,后续数周将分阶段公开更多代码、训练配置和评估报告。

但需要先说清楚:MiMo v2.6 目前更像一次围绕强化学习训练链路展开的重大版本升级,而不是已经全面替换 MiMo v2.5 的线上推理模型。小米在 2026 年 6 月底已经下线 MiMo v2-pro、MiMo v2-omni、MiMo v2-flash 等旧型号,并将服务迁移到 v2.5 系列;此次 v2.6 发布,尚未意味着开发者可以立刻把生产环境全部切换到新版本。

MiMo v2.6 到底更新了什么

**MiMo v2.6 是小米 MiMo 系列面向大规模强化学习训练的一次新版本升级,重点在于提高训练吞吐、环境适配和奖励反馈质量。**这与传统意义上“模型参数变大、榜单分数变高”的版本迭代不完全相同。

目前公开的升级点主要集中在四个方面:

  1. **更大的单步处理规模。**公开资料显示,MiMo v2.6 的单步处理规模达到 20 亿 Token,并行生成能力达到 1568 个 Prompt。
  2. **完全异步的训练架构。**模型生成、环境运行、结果收集和参数更新不再被锁在同一个同步循环里。
  3. **多任务智能体强化学习。**单个运行周期内可以混合调用多个任务框架和环境,面向复杂 Agent 任务进行联合训练。
  4. **GraderCompute 评分模块。**小米为奖励模型和测试用例评估配置专用算力,希望减少评分环节成为训练瓶颈的问题。

小米 MiMo v2.6 强化学习训练链路示意图,展示模型生成、环境执行、GraderCompute 评分和参数更新之间的异步数据流

其中,20 亿 Token 这个数字需要正确理解。它不是说模型一次上下文窗口可以装下 20 亿 Token,也不是说单个用户请求可以直接输入这么长的文本,而是训练系统在一个处理步或一个调度周期内可以组织和处理的 Token 规模。对于强化学习训练来说,模型需要不断生成答案、执行任务、读取环境反馈,再根据奖励更新策略。吞吐量越高,单位时间里能够跑的试验次数越多。

1568 个 Prompt 并行也不是简单地把聊天请求复制 1568 次。它更接近一座同时运行上千条实验轨道的训练工厂:有些任务在生成代码,有些任务在操作工具,有些任务在等待执行结果,另一些任务则已经进入评分阶段。如果这些环节全部同步,最慢的任务会拖住整个批次;异步架构的价值,就在于让不同任务可以按照自己的进度流动。

强化学习的瓶颈,往往不在模型本身

**强化学习训练是让模型通过环境反馈反复试错,而不是只依赖静态语料进行监督学习。**在 Agent、代码执行、数学推理和工具调用场景中,模型的输出是否有效,通常要等它真正执行一次任务后才能判断。

例如,一个代码 Agent 生成了一段修复补丁,训练系统需要把补丁放进隔离环境,运行测试用例,再判断测试是否通过;一个浏览器 Agent 规划了多步操作,系统需要启动浏览器、执行点击和输入、检查页面状态,最后决定这次轨迹应该得到多少奖励。

这类训练有一个明显特点:模型推理只是其中一环,环境执行和评分同样消耗大量资源。传统的同步流程大致是:

生成一批答案 → 等待所有环境执行 → 统一评分 → 更新模型 → 再生成下一批

其中只要有一个环境执行速度很慢,整个批次就必须等待。任务难度不均衡时,算力会被大量浪费在“等结果”上。

MiMo v2.6 强调完全异步架构,解决的正是这个问题。更理想的流程是:

任务 A 生成 → A 执行 → A 评分 → A 更新
任务 B 生成 → B 执行中
任务 C 已完成评分 → 等待汇总
任务 D 生成下一轮轨迹

这种设计不一定会直接让单次回答更快,但可以显著提升训练集群的有效利用率。对于小米而言,它的意义在于:当训练任务从单一数学题扩展到代码、搜索、浏览器、工具调用和多模态交互后,环境的速度差异会越来越大,异步调度会从优化项变成基础设施能力。

GraderCompute:把评分器从“附属组件”变成独立系统

GraderCompute 是为强化学习评分过程配置专用算力和评估资源的模块,目标是提高奖励反馈的速度与一致性。

在强化学习里,奖励函数决定了模型“什么行为值得重复”。如果评分器不稳定,模型可能学会投机取巧;如果评分过程太慢,训练吞吐就会被评分环节卡住;如果测试用例覆盖不足,模型可能只是在记住一套固定套路,而不是获得真正的泛化能力。

小米公开的信息显示,GraderCompute 会结合测试案例库和动态评分标准,对模型轨迹进行评估。它至少包含三层含义:

  • **独立算力。**评分任务不再完全挤占模型生成和训练更新的资源。
  • **测试案例库。**通过可复现的任务集合,对代码、工具调用和复杂流程进行自动验证。
  • **动态评分标准。**不同任务可以根据完成度、正确性、步骤成本和最终结果计算不同奖励。

这套设计对 Agent 训练尤其重要。一个 Agent 不应该因为输出了一段看起来合理的文字就获得高分,而应该根据任务是否真正完成来获得奖励。比如,自动化办公 Agent 的评价不只是“回复是否通顺”,还包括表格是否修改正确、文件是否保存成功、权限是否越界以及整个操作是否在规定步骤内完成。

当然,GraderCompute 也会带来新的问题。评分器本身可能存在偏差,测试集可能被模型过拟合,动态奖励规则也可能导致训练目标不断漂移。因此,真正值得关注的不是小米是否公布了一个模块名称,而是后续会不会公开评分器设计、任务分布、失败样例和独立评测结果。如果只有吞吐量数据,没有可复现实验,外部开发者很难判断 v2.6 的技术进步究竟来自模型能力,还是来自训练调度优化。

与 MiMo v2.5 的关系:不是简单替换,而是训练路线变化

**MiMo v2.5 是当前 MiMo 线上服务的主力系列,MiMo v2.6 则更强调强化学习系统和智能体训练能力。**两者目前不能简单理解为“旧模型”和“新模型”的直接替代关系。

MiMo v2.5 此前公开的重点,是 Hybrid Sliding Window Attention、稀疏 MoE 和多模态 Encoder 等架构与推理效率优化。Hybrid SWA 通过混合窗口注意力减少长上下文场景下的 KV Cache 存储,官方技术文章称其 KV Cache 存储量可降至 Full Attention 的约 1/7;MoE 则通过稀疏激活,在保持较大模型容量的同时减少每个 Token 的实际计算量。

MiMo v2.6 的重点则从“怎样更高效地运行模型”进一步延伸到“怎样更高效地训练模型完成复杂任务”。可以把两者简单类比为:v2.5 更像是对发动机、变速箱和散热系统做优化,v2.6 则是在重新设计整条测试赛道、计时系统和训练流程。

| 对比项 | MiMo v2.5 | MiMo v2.6 | |---|---|---| | 当前定位 | 线上推理与产品服务主力系列 | 强化学习与智能体训练升级版本 | | 公开重点 | Hybrid SWA、MoE、多模态 Encoder、推理效率 | 异步强化学习、环境适配、奖励评估 | | 长上下文优化 | KV Cache 存储约为 Full Attention 的 1/7 | 暂未公开新的上下文窗口或 KV Cache 指标 | | 并行处理信息 | 公开重点在推理服务与缓存系统 | 单步 20 亿 Token、1568 个 Prompt | | 评分机制 | 未突出独立评分算力模块 | 引入 GraderCompute | | 开发者可用性 | 已接入现有服务和模型套餐 | 尚需等待更多模型、权重或服务细节 | | 版本替代关系 | 当前线上主力 | 暂不宜视为 v2.5 的直接替换品 |

这也是目前判断 MiMo v2.6 时最容易被忽略的一点:一个训练系统版本的发布,不等于一个可以马上调用的新模型已经完成商业化上线。开发者真正关心的模型名称、上下文长度、输入输出模态、价格、速率限制、权重许可和评测成绩,仍需要等待小米进一步公布。

小米为什么现在强调强化学习

**强化学习正在成为大模型从“会回答”走向“能完成任务”的关键训练方法。**当模型只需要写一段文字时,监督微调往往已经足够;但当模型要连续调用工具、执行代码、浏览网页或操作设备时,最终结果比单轮文本质量更重要。

过去一年,模型竞争的焦点逐渐从参数规模转向任务闭环。一个 700 字的回答写得很漂亮,并不代表它能修好一个真实项目;一个数学推导看起来完整,也不代表最后答案正确;一个 Agent 能生成十步计划,也不代表它可以在网页变化后及时修正路径。

强化学习适合处理这类问题,因为它可以直接围绕“任务是否完成”来优化模型行为。但强化学习的成本也更高:模型要生成更多候选轨迹,环境要执行更多次任务,评分器要检查更多结果,训练过程还要处理失败、超时和异常状态。

小米披露的 125 万美元累计投入,说明它正在把强化学习看成一项长期基础设施工程,而不是一次短期榜单冲刺。这个投入规模在大模型训练中并不算特别夸张,但如果主要用于环境运行、评测算力和算法迭代,它可能比单纯购买更多预训练 Token 更能说明团队的路线选择。

从行业竞争角度看,小米的优势不只在模型团队本身。小米拥有手机、汽车、智能家居和 IoT 设备生态,这些产品可以提供相对真实的多模态交互环境:视觉输入、语音指令、设备状态、空间信息和连续操作都可能成为未来训练数据或评测场景。若 MiMo v2.6 的强化学习系统最终能够与这些真实环境结合,它的目标就不只是做一个聊天模型,而是训练能够在设备和现实世界中执行任务的 Agent。

对开发者意味着什么

**MiMo v2.6 对开发者的短期价值,主要在于释放路线信号,而不是立即提供一个可替换的线上端点。**如果你正在使用 MiMo 服务,当前更重要的是确认自己的应用是否已经完成 v2.5 迁移。

小米此前已在 2026 年 6 月 30 日正式下线 MiMo v2-pro、MiMo v2-omni、MiMo v2-flash 和 MiMo v2-tts,服务分别迁移到 v2.5 系列。尤其需要注意的是,mimo-v2-flash 迁移到 mimo-v2.5 后,默认参数发生变化:思考模式默认值从 disabled 变为 enabled,temperature 默认值从 0.3 变为 1.0,max_completion_tokens 默认值从 65536 变为 32768。对于依赖稳定输出、严格延迟或固定 Token 预算的应用,这些变化可能造成实际行为差异。

因此,开发者现在应该优先做三件事:

  • **重新核对模型名称和路由。**不要假设旧模型名称仍然有效,也不要把 v2.6 的发布理解为现有请求会自动升级。
  • **重新测试默认参数。**特别是思考模式、最大输出长度、温度和长上下文任务,迁移后的默认值可能改变延迟和成本。
  • **关注后续开源内容。**如果小米公开训练配置、评分器接口、环境适配代码和评测报告,v2.6 对开源 Agent 社区的价值会明显提升。

对于做代码 Agent、浏览器 Agent、智能家居自动化和多模态应用的团队,v2.6 更值得关注。它说明小米正在把模型训练从静态数据集推进到动态任务环境中。未来如果开放的不是一套孤立权重,而是包括环境、评分器、训练脚本和评测集在内的完整组件,开发者才有机会真正复现这套路线。

还缺什么数据

**MiMo v2.6 当前最明显的缺口,是缺少足够完整的模型性能和商业化信息。**公开的 20 亿 Token、1568 个 Prompt 和 125 万美元投入,能够说明训练基础设施规模,却不能直接证明模型在真实任务中的能力已经领先。

至少还需要以下数据,才能判断 v2.6 是否构成实质性升级:

  1. **标准评测成绩。**包括代码生成、数学推理、工具调用、长上下文和多模态理解等任务,与 MiMo v2.5、DeepSeek、Qwen、GLM 等模型进行同条件对比。
  2. **Agent 完成率。**不能只公布单轮准确率,还需要展示多步任务成功率、平均执行步数、失败恢复能力和工具调用错误率。
  3. **训练效率指标。**包括每秒有效 Token、环境执行吞吐、评分延迟、GPU 利用率以及单位任务成本。
  4. **模型规格。**包括总参数量、激活参数量、上下文长度、支持的模态、是否开源权重及其许可证。
  5. **线上服务信息。**包括模型名称、可用区域、价格、并发限制、延迟和是否兼容现有 MiMo v2.5 接口。

没有这些数据,v2.6 目前更适合被看作“小米对下一阶段模型训练方向的公开亮相”,而不是已经完成产品验证的终局版本。

OpenAI Hub 观察

MiMo v2.6 的真正看点不是“又一个国产大模型版本”,而是小米开始把强化学习的竞争从算法论文推进到大规模工程系统。

在大模型行业进入后训练竞争之后,谁能更便宜、更稳定地生成大量任务轨迹,谁能构建更可靠的自动评分器,谁就更可能把模型能力从基准题迁移到复杂工作流。MiMo v2.6 公布的异步架构、多任务环境和 GraderCompute,正好对应这三个关键环节。

但它能否成为真正有影响力的版本,还要看后续公开内容。若小米只发布概念和训练规模,v2.6 的价值会停留在技术路线层面;若它进一步开放可复现代码、任务环境、评分器和性能报告,那么这次更新可能会成为国内开源 Agent 训练基础设施的一次重要补课。

现阶段,开发者不必急着迁移生产系统,也不应把 v2.6 的训练指标直接等同于模型能力提升。更合理的做法是:继续使用已经稳定的 MiMo v2.5 服务,同时关注 v2.6 后续是否发布正式权重、API 模型名、评测结果和开源仓库。对小米来说,这一版本真正的考验才刚开始——从“能把训练跑起来”,走到“能让模型在真实世界里把任务做完”。

参考来源

注:本文关于 MiMo v2.6 的版本定位、训练规模、异步架构、GraderCompute 和后续开源计划,依据小米 MiMo v2.6 官方发布页及公开报道整理。模型权重、正式接口、定价和完整评测数据以小米后续公告为准。

相关推荐

查看全部