AI 快讯小米把大模型训练过程公开了
行业快讯

小米把大模型训练过程公开了

2026-09-16T23:06:57.340Z
小米把大模型训练过程公开了

小米近日上线 MiMo 2.6 实时训练仪表盘,公开展示强化学习训练过程与模型能力变化。它未必意味着训练完全透明,但至少让大模型从“只看最终成绩”走向“观察训练过程”。

小米把大模型训练过程公开了:MiMo 2.6 开始实时展示训练曲线

小米近日公开了 MiMo 2.6 实时训练仪表盘,外部用户可以通过网页观察模型在强化学习训练阶段的状态变化。这是大模型训练公开方式的一次变化:过去,开发者通常只能看到模型发布后的参数规模、基准测试成绩和技术报告;现在,小米开始把模型从“结果”推进到“过程”层面。

**实时训练仪表盘是指以网页或可视化面板持续展示模型训练过程中关键指标变化的系统。**它通常会呈现训练步数、奖励分数、损失函数、任务成功率、吞吐量以及不同评测集上的能力曲线。与一次性发布的 benchmark 表格相比,仪表盘更像是给模型训练装上了“示波器”:用户不仅能看到最终电压,还能观察它如何升高、波动,甚至失控。

小米 MiMo 2.6 实时训练仪表盘页面,展示强化学习训练进度与模型能力曲线

这次公开,重点不在“又一个新模型”

MiMo 2.6 仪表盘目前最值得关注的地方,不是小米又公布了多少参数,而是它改变了大模型能力发布的叙事方式。

传统模型发布通常遵循一条固定路径:公布模型名称,介绍架构和训练数据,再给出若干基准测试成绩。用户看到的是一个已经完成训练的静态版本,至于模型经历了多少轮筛选、哪些任务让它获得奖励、哪些能力在训练中出现回退,外部很难知道。

MiMo 2.6 的实时页面则把训练阶段的一部分状态暴露出来。即使外部用户无法看到完整数据集、奖励模型或训练集群配置,至少也可以观察模型在持续强化学习中的变化趋势。这种展示方式对开发者的意义在于:模型能力不再只是一个“发布会数字”,而是一个会随着训练步数变化的动态对象。

**强化学习训练是通过奖励信号推动模型更倾向于产生高质量行为的后训练过程。**在大模型领域,它通常位于预训练和监督微调之后,主要用于增强推理、编码、工具调用、任务执行等能力。模型每完成一次任务,系统会根据答案是否正确、代码是否通过测试、工具调用是否成功等结果给出奖励,再利用这些信号更新模型。

这类训练并不像把题库答案喂给模型那么简单。奖励设计得过于宽松,模型可能学会投机取巧;奖励过于严格,训练可能不稳定;某项能力提升过快,还可能带来其他能力下降。公开训练曲线,恰好能让外部观察者看到这些变化是否存在。

为什么实时训练比最终跑分更有价值

**单次 benchmark 只能回答模型“最后考了多少分”,而训练曲线能够回答模型“能力是如何形成的”。**这两者并不等价。

例如,一个模型在数学评测上最终得到较高分数,可能来自更有效的推理训练,也可能来自训练数据与测试集之间的重叠;一个模型在代码任务上分数上升,也可能是因为它真正学会了调试,或者只是更擅长生成符合测试格式的答案。只看最终分数,很难区分这两种情况。

如果仪表盘能够同时展示训练步数、奖励均值、任务成功率和独立评测结果,开发者就有机会判断模型能力是否稳定增长。理想状态下,奖励曲线与真实任务成功率应该大致同步;如果奖励持续上升,但独立评测停滞甚至下降,就可能出现奖励投机,也就是模型学会迎合评分机制,却没有真正提升泛化能力。

对于长链路 Agent 任务,这种可观测性尤其重要。一个 Agent 模型不是只生成一段文本,而是要经历规划、调用工具、读取返回结果、修正错误和完成最终交付等多个步骤。单步回答的正确率并不能代表整个任务的成功率。训练过程中,模型可能先学会调用工具,再学会在工具失败后重试,最后才形成稳定的任务闭环。

从这个角度看,实时训练仪表盘的价值类似于软件工程里的 CI 面板:它不直接替你修复 bug,但能够告诉你哪个版本开始回归、哪一类测试出现异常,以及系统是否正在朝正确方向演进。

MiMo 之前,训练公开通常停留在“论文级”

过去的大模型训练透明度,大致可以分成三层。

第一层是发布结果透明。模型团队公布参数规模、上下文长度、训练数据类型、推理成本和基准测试成绩。这是目前最常见的方式,但它只能让外界看到终点。

第二层是方法透明。团队进一步公开模型架构、训练配方、强化学习算法和评测方法。例如,小米此前围绕 MiMo-V2-Flash 公开介绍过混合滑动窗口注意力、Multi-Token Prediction,以及 Multi-Teacher On-Policy Distillation 等技术路线。这些内容能帮助研究者理解模型为什么可能更快、更便宜,或者更适合 Agent 任务,但仍然无法还原一次真实训练运行。

第三层是运行透明。训练仪表盘属于这一层。它展示的不只是“我们使用了什么方法”,还包括“这些方法在当前训练中产生了什么变化”。这一步更接近工程现场,也更接近开发者真正关心的问题:训练是否稳定?奖励是否饱和?模型有没有出现能力退化?什么时候应该停止训练?

MiMo 2.6 此次公开的意义,主要就在第三层。它未必意味着小米会开放全部训练数据、权重更新过程或内部评测集,但它至少把训练从封闭的实验室日志,搬出了一部分到公开网页上。

它可能展示什么,又没有展示什么

需要明确的是,可观测不等于完全透明。一个训练仪表盘能公开多少信息,取决于页面展示范围和小米愿意披露的指标。

从大模型训练的工程实践看,外部用户最希望看到的指标通常包括以下几类:

  • 训练进度:当前训练步数、阶段名称、预计完成时间或运行状态。
  • 优化指标:训练损失、策略损失、价值损失、熵值等,用于判断优化是否稳定。
  • 奖励指标:平均奖励、最高奖励、奖励分布,以及不同任务类别的奖励变化。
  • 能力评测:数学、代码、知识问答、工具调用、长上下文和 Agent 任务的阶段性结果。
  • 效率指标:训练吞吐、样本处理速度、GPU 利用率或单位能力提升所需的算力。
  • 异常信号:奖励塌缩、梯度异常、评测回退、数据分布漂移等训练风险。

但即便这些指标全部公开,外界仍然无法仅凭曲线复现训练结果。真正决定模型能力的,往往还包括数据筛选规则、奖励模型质量、任务生成器、验证环境、采样策略、并行方式以及训练中大量未公开的工程细节。

因此,MiMo 2.6 仪表盘更适合被理解为“训练过程的窗口”,而不是“训练配方的源代码”。它能帮助外界判断趋势,却不能让任何人照着页面就复刻出同一个模型。

与此前 MiMo 路线的连接

这次训练可视化并不是孤立动作,而是延续了小米 MiMo 近一年强调的 Agent 和强化学习路线。

小米此前发布的 MiMo-V2-Pro 面向复杂 Agent 场景,强调超过 1T 的总参数规模、42B 激活参数、混合注意力架构和 1M 上下文窗口。MiMo-V2-Flash 则进一步把重点放在推理效率、代码能力和成本控制上,公开资料显示,该模型总参数量为 309B,激活参数量为 15B,支持 256K 上下文窗口;其混合滑动窗口注意力采用 5 层局部注意力搭配 1 层全局注意力,局部窗口为 128 个 token。

这些技术选择共同指向一个判断:小米并不只想做一个“聊天模型”,而是希望把 MiMo 训练成能够长期执行任务的模型基座。对于这类模型,后训练和强化学习的重要性会持续上升。

MiMo 团队此前还介绍过 Multi-Teacher On-Policy Distillation,即多教师在线策略蒸馏方法。**在线策略蒸馏是指让学生模型在自身生成行为的基础上,从多个教师模型获得更密集的监督信号。**相比只依赖最终结果的强化学习,这种方法可以在 token 或步骤层面提供更细的反馈,从而改善训练效率和稳定性。

如果 MiMo 2.6 的仪表盘能够呈现不同训练阶段的能力变化,那么它有机会让外界观察到这些后训练方法究竟如何影响模型。例如,模型是先提升代码修复能力,还是先提升工具调用成功率;长任务一致性是在奖励上升之前改善,还是在后期才出现;训练是否在速度与能力之间进行折中。这些信息,比单纯说“模型更强了”更有研究价值。

对开发者来说,最该看哪些信号

对于普通用户,实时曲线可能只是新鲜的可视化页面;对于模型开发者,它可以成为判断模型是否值得接入的重要参考。

首先看能力曲线是否持续增长。如果模型在训练早期快速提升,随后长时间横盘,说明当前训练配方可能已经触及收益瓶颈。继续增加算力不一定有效,团队可能需要调整数据、奖励函数或任务难度。

其次看不同任务之间是否均衡。一个面向 Agent 的模型不能只看数学和代码分数。如果编码能力上升,但工具调用、网页操作或长任务成功率不动,模型对真实工作流的帮助可能有限。

第三看奖励与实际成功率是否一致。奖励越高不代表任务一定完成得越好。对于代码 Agent,真正有意义的是测试是否通过;对于浏览和工具调用,关键是任务是否闭环完成,而不是模型是否生成了更长的思考过程。

最后看训练后期是否出现回退。大模型强化学习经常存在能力拉扯:推理变强后,响应速度可能下降;回答变得更谨慎后,简单任务可能变慢;长上下文能力提升后,短问题的指令遵循可能发生变化。仪表盘如果能把这些回退暴露出来,才真正具备工程价值。

公开训练,也会带来新的争议

实时展示并不意味着所有数据都应该被公开。训练曲线可能暴露模型的能力边界、训练节奏甚至评测任务分布,使外部团队更容易针对性优化;如果页面更新不加说明,用户还可能把实验阶段数据误认为最终模型能力。

因此,训练仪表盘需要同时具备三种能力:数据可解释、指标可比较、状态有标注。比如,页面应该清楚区分训练集内指标与独立评测指标,说明曲线是否经过平滑处理,标注当前模型是否仍在实验阶段,并解释不同任务的样本规模和评分方式。

否则,仪表盘可能只是另一种发布会素材:曲线不断上扬,但外部无法判断纵轴代表什么,也无法知道模型是否在真实任务中同步变强。

行业真正需要的,是可验证的训练过程

小米这次动作的价值,暂时不在于它已经提供了多少完整数据,而在于它提出了一个值得行业继续追问的问题:大模型能不能像软件版本一样,被持续观察和验证?

过去,模型竞争主要围绕参数规模、训练语料和最终跑分展开。随着模型进入 Agent 阶段,竞争对象正在从“谁的回答更像人”,转向“谁能稳定完成更长、更复杂的任务”。这会迫使模型团队公开更多过程指标,因为只公布一个最终分数,已经不足以解释真实能力。

**MiMo 2.6 实时训练仪表盘的核心意义,是把大模型训练从一次性成果展示,推进到持续过程观测。**它还不能解决模型评测不可复现、奖励函数不透明和训练数据不可审计等问题,但它为行业提供了一个方向:未来的模型发布,可能不再只有一份静态技术报告,而会包含可追踪的训练记录、阶段性评测和能力回归信息。

对开发者而言,值得关注的不是某条曲线今天涨了多少,而是小米是否会持续更新这套系统,是否会公布指标定义,是否允许外部评测与仪表盘结果交叉验证。如果这些环节能够补齐,MiMo 2.6 才可能从一次产品展示,变成大模型训练可观测性的长期实验。

参考来源

  1. 小米 MiMo 官方实时训练仪表盘:MiMo 2.6 强化学习训练过程公开页面。
  2. 小米 MiMo 官方产品与新闻资料:MiMo-V2-Pro、MiMo-V2-Flash 及 MiMo 后训练路线介绍。
  3. 《MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training》:小米 MiMo 团队关于多教师在线策略蒸馏的研究说明。
  4. 公开技术报道:关于 MiMo-V2-Flash 参数规模、混合注意力、Agent 评测和训练基础设施的资料汇总。

本文根据小米 MiMo 公开页面及相关公开资料整理。MiMo 2.6 仪表盘中的训练指标可能随运行状态更新,具体数值应以页面实时显示为准。

相关推荐

查看全部