AI 快讯MiniMax M3 Pro冲向3T
模型上新

MiniMax M3 Pro冲向3T

2026-08-26T15:05:34.089Z
MiniMax M3 Pro冲向3T

MiniMax确认M3 Pro参数规模预计达到约3T,并加码强化学习与长程任务训练。真正的考题不是模型有多大,而是推理成本、Agent能力和国产算力能否同时兑现。

MiniMax把下一代旗舰模型推向3T参数

MiniMax在今天(2026年8月26日)的中期业绩电话会上预告,下一代旗舰模型M3 Pro的参数规模预计提升至约3T,同时进一步扩大强化学习和长程任务训练,以提高模型的泛化能力与智能上限。

3T参数规模是指模型拥有约3万亿个可学习参数,但它不等于每次推理都会调用全部3万亿参数。 MiniMax目前没有披露M3 Pro采用稠密架构还是混合专家架构(MoE),也没有公布激活参数量,因此暂时无法仅凭“3T”判断实际训练成本、推理速度和部署门槛。

这也是今天这次预告最需要划重点的地方:MiniMax确认了规模方向,却还没有交出决定开发者体验的关键数字。

MiniMax M3 Pro约3T参数、强化学习、长程任务训练与国产算力集群关系示意图

IT之家8月26日报道,MiniMax创始人兼CEO闫俊杰表示,公司下一阶段将协同提升模型智能、推理效率和基础设施能力,并加快M系列与H系列模型的研发及发布周期。与此同时,MiniMax正在推进M3和H3的国产芯片适配,大规模国产算力集群将很快上线,并逐步承接真实生产流量。

M3 Pro目前仍是预告中的模型,而不是已经完成公开发布、可由第三方全面验证的产品。 截至8月26日,MiniMax尚未同步公布M3 Pro的正式发布日期、模型权重开放方式、上下文长度、激活参数量、推理价格、吞吐量或标准基准成绩。此前市场流传的2.7万亿参数,更接近训练阶段或媒体获得的估计值;本次电话会上出现的“约3T”,则是公司给出的最新规模预期。

2.7T变成约3T,重点不在多出来的3000亿

2.7T与约3T之间约有3000亿参数的差距,但这个差距未必代表模型设计在短期内发生了根本变化。 大模型在训练、裁剪、专家配置和最终发布时,统计口径可能不同;“预计约3T”也可能是对最终规模的取整表达,而不是已经冻结的精确参数数字。

从公开信息看,M3 Pro当前可以确认与不能确认的内容如下:

| 项目 | 当前公开信息 | 是否已确认 | 对实际使用的意义 | |---|---|---:|---| | 模型名称 | MiniMax M3 Pro | 是 | M系列下一代旗舰模型 | | 参数规模 | 预计约3T;此前媒体信息指向约2.7T | 部分确认 | 代表容量上限,不直接等于推理能力 | | 模型架构 | 尚未披露 | 否 | 决定每次推理激活多少参数及硬件需求 | | 激活参数量 | 尚未披露 | 否 | 比总参数量更直接影响速度与成本 | | 强化学习 | 将进一步扩大 | 是 | 重点改善推理、工具使用和任务完成能力 | | 长程任务训练 | 将进一步扩大 | 是 | 面向多步骤Agent、深度研究和复杂工作流 | | 上下文长度 | 尚未披露 | 否 | 决定一次可读取的信息量,但不等于长程执行能力 | | 开源计划 | 此前有相关市场信息,最新电话会摘要未明确细节 | 否 | 需等待许可证、权重与部署方案落地 | | 正式发布日期 | 尚未公布 | 否 | 仍需等待官方发布 | | 国产芯片适配 | M3、H3正在推进适配 | 是 | 为推理供给和基础设施自主性做准备 |

参数规模更像发动机排量,而不是整车圈速。 一台车可以装上更大的发动机,但最终速度还取决于变速箱、底盘、轮胎和控制系统;同样,3T模型能否比更小模型更强,要看数据质量、架构设计、后训练方法、推理时计算、工具调用以及系统工程是否匹配。

如果M3 Pro采用MoE架构,那么3T更可能是总参数量,单个Token只激活其中一部分专家。MoE是通过路由器为不同输入选择少量专家子网络的模型架构,目标是在扩大总容量的同时控制单次计算量。 这类设计可以让模型“知识仓库”更大,但路由稳定性、专家负载均衡、跨卡通信和显存占用都会变成新的工程难题。

如果M3 Pro采用接近稠密模型的高激活比例,那么部署压力会明显上升。即使使用低精度权重,万亿级参数带来的显存、带宽和节点通信需求仍然巨大;在这种情况下,模型能力即使足够强,也可能因响应速度和单位Token成本过高而难以承接大规模生产流量。

MiniMax真正押注的是长程Agent,而不只是大模型跑分

强化学习是利用奖励信号优化模型行为的后训练方法,它决定模型是否能从“会回答”进一步走向“会完成任务”。 对M3 Pro而言,扩大强化学习意味着训练重点可能从单轮问答、数学题和代码补全,转向工具选择、步骤规划、结果校验、错误恢复与任务闭环。

长程任务训练是让模型在较长时间跨度和较多操作步骤中持续保持目标、状态与约束的训练方式。 它与“百万上下文”不是一回事:上下文长度解决的是模型能读多少,长程任务能力解决的是模型能否在几十步甚至上百步操作后仍然记得目标,并知道下一步该做什么。

一个拥有超长上下文但缺乏长程训练的模型,可能读得下一整个代码仓库,却在修改三个文件后忘记最初的接口约束。一个经过长程任务训练的模型,则需要在检索文档、定位问题、修改代码、运行测试、分析报错和再次修复之间维持连贯状态。

这类能力尤其影响以下场景:

  • 复杂编程任务: 跨文件修改、依赖升级、测试修复与代码审查需要连续执行多个步骤。
  • 深度研究: 模型需要检索多个来源、辨别冲突信息、建立证据链并生成可追溯结论。
  • 企业流程自动化: 报表读取、规则判断、系统操作与审批提交必须满足明确约束。
  • 多模态工作流: 文本、图片、音频或视频信息需要在同一任务链中被持续引用。
  • 长时间运行的Agent: 模型需要处理工具失败、权限不足、网页变化与中间结果偏移。

长程任务最难的不是把任务做长,而是控制错误累积。 假设一个Agent每一步正确执行的概率为99%,连续完成100个彼此依赖的步骤,理论上的全程无误概率只有约36.6%;如果单步成功率是98%,100步全对的概率会进一步降至约13.3%。这说明长程Agent不能只依靠基础模型“更聪明”,还需要检查点、回滚、外部记忆、结果验证和动态重规划。

MiniMax在电话会上同时强调泛化能力,也说明M3 Pro的目标不应只是刷高固定题库成绩。泛化能力是模型在未见过的任务、领域和组合条件下仍能稳定解决问题的能力。 对开发者而言,泛化能力比单项Benchmark峰值更重要,因为真实生产请求通常不会严格复制训练题格式。

3T模型的最大挑战,是推理效率而非训练完成

M3 Pro能否成功,首先取决于MiniMax能否把3T级容量转化为可接受的推理效率。 训练出一个超大模型只是一次性工程,面向用户持续提供推理服务才是长期成本中心;请求越多,推理端的算力、显存、网络和调度压力越大。

闫俊杰把“模型智能、推理效率和基础设施能力”放在同一句话中并不偶然。模型规模继续扩张后,三者必须形成闭环:模型更强才能吸引使用,推理更快才能扩大调用量,基础设施更稳才能控制成本,而更多真实流量又能为后训练提供反馈。

市场现在最容易误读的是“参数越多,能力越强”。更准确的说法是,参数越多通常意味着更高的容量上限,但最终能力取决于参数是否被有效训练和调用。训练数据重复、专家利用率不均、奖励模型偏差或后训练不足,都可能让新增参数变成昂贵的冗余。

开发者评估M3 Pro时应优先关注每次推理实际激活多少参数。 总参数量决定模型需要存放多大的权重集合,激活参数量则更接近单次前向计算的工作量;如果MiniMax能以相对较低的激活规模调度3T总参数,M3 Pro才有机会同时获得容量和成本优势。

正式发布后,至少有八项指标值得检查:

  1. 总参数量与激活参数量分别是多少;
  2. 首Token延迟和持续输出速度是多少;
  3. 输入、输出的单位Token价格是多少;
  4. 上下文窗口与有效上下文利用率是多少;
  5. 代码、数学、搜索和工具调用成绩是否可复现;
  6. 长程任务在50步、100步后的成功率如何;
  7. 并发升高后是否出现明显降速或稳定性下降;
  8. 权重、许可证和本地部署工具是否真正开放。

如果M3 Pro只公布总参数和几个高分Benchmark,它很难证明自己已经解决了生产问题。 真正有说服力的发布应同时给出端到端任务成功率、推理配置、成本数据和第三方可复现结果,尤其要展示模型在长链路中遇到错误后能否自我纠正。

国产算力集群将先接受生产流量检验

国产算力适配是让模型训练或推理软件栈运行在国产AI芯片及其集群环境中的工程过程。 这不只是把模型文件复制到另一套服务器,而是涉及算子实现、精度对齐、图编译、显存管理、节点通信、故障恢复和调度系统的重新优化。

MiniMax此次确认,M3和H3的国产芯片适配正在推进,大规模国产算力集群将很快上线并逐步承担真实生产流量。这个表述释放了两个信号:第一,国产集群的近期任务更可能是推理承载,而不是直接承担3T级模型的完整训练;第二,公司准备让它从测试环境进入实际业务,而不是停留在兼容性演示阶段。

推理先行是更现实的路线。训练要求数千张甚至更多加速卡长时间保持高效同步,任何单点故障、通信拥塞或软件异常都可能影响整个训练任务;推理请求则可以按模型、地区和业务类型逐步迁移,更容易控制风险,也便于在真实流量中持续优化。

国产集群是否成熟,最终要看有效吞吐而不是芯片峰值算力。 对在线服务而言,单卡理论性能只是起点,批处理效率、首Token延迟、跨节点带宽、缓存命中率和故障恢复时间共同决定一套集群每天能处理多少有效Token。

M3与H3同时适配也有工程价值。M系列面向通用智能任务,H系列则涉及通用视频等更强调多模态和高带宽的工作负载;两类模型如果都能稳定运行,可以更全面地检验国产软硬件栈,而不是只针对单一语言模型做定向优化。

收入高速增长,但3T投入仍然昂贵

MiniMax上半年的收入增长很快,但财务数据也说明公司仍处于高投入阶段。 根据8月26日披露的2026财年上半年报告,公司营业总收入为1.17亿美元,同比增长283.1%;毛利润为2081.3万美元,同比增长464.8%;毛利率为17.9%。

| 财务指标 | 2026财年上半年数据 | 同比变化 | |---|---:|---:| | 营业总收入 | 1.17亿美元 | 增长283.1% | | 毛利润 | 2081.3万美元 | 增长464.8% | | 毛利率 | 17.9% | 未披露同比百分点 | | 归母净利润 | -3.58亿美元 | 亏损收窄11% | | 基本每股收益 | -1.18美元 | — | | 稀释每股收益 | -1.18美元 | — | | 资产负债率 | 21.5% | — |

归母净亏损3.58亿美元约为同期收入的3.06倍,这意味着模型研发、算力和业务扩张仍在消耗大量资金。毛利润增速高于收入增速是积极信号,但17.9%的毛利率仍不足以自动覆盖3T模型持续训练和大规模推理所需的基础设施开支。

M3 Pro因此不仅是一场模型能力考试,也是一场商业效率考试。 如果新模型显著提升Agent任务完成率,却需要过高的推理成本,使用量越大可能反而带来越重的算力压力;如果MiniMax通过MoE、量化、推测解码、缓存和集群调度把成本压下来,模型能力才可能转化为可持续收入。

M3 Pro有机会重返牌桌,但参数不是入场券

MiniMax继续扩大参数规模,说明它没有放弃基础模型上限竞争。 在行业越来越强调小模型、蒸馏和低成本推理的阶段,MiniMax仍然选择训练约3T规模的旗舰模型,实际押注是:更大的底座经过强化学习后,能在复杂推理、编程和长程Agent任务上拉开足够明显的差距。

这项选择并非没有道理。轻量模型适合高频、标准化和低延迟任务,但复杂研究、跨系统操作与长链路代码工程仍然需要更高的模型容量。问题在于,旗舰模型必须证明新增能力足以覆盖新增成本,而不能只在排行榜上领先几个百分点。

M3 Pro最值得期待的部分是强化长程任务训练,而不是“3T”这个标题数字。 参数规模可以迅速制造关注度,长程任务成功率却直接决定模型能否进入真实生产流程;前者是技术上限的信号,后者才是产品价值的证据。

对开发者来说,现在不必急着根据预告调整技术选型。更合理的做法是等待正式模型卡、价格、许可证和第三方评测,再用自己的真实任务集测试:代码仓库修改是否一次完成、研究报告是否能追溯来源、工具调用是否稳定、连续运行是否偏离目标,以及相同预算下能完成多少任务。

MiniMax已经把M3 Pro的预期抬到了约3T,但下一步必须用可复现结果兑现这个数字。 如果它能同时交出较低激活参数、高长程任务成功率、稳定生产吞吐与开放生态,M3 Pro会成为国产大模型规模竞赛的重要节点;如果这些信息缺席,3T就仍然只是一个昂贵且醒目的参数标签。

参考来源

相关推荐

查看全部