千问125B闪电模型明日登场

Qwen3.8-Flash-Next预计8月26日发布,总参数125B、每Token激活约6B。它瞄准的不是旗舰跑分,而是更高吞吐、更低成本的实际推理。
Qwen 团队将在明天(8月26日)发布 Qwen3.8-Flash-Next,这是一款总参数量约 125B、每个 Token 激活约 6B 参数的稀疏混合专家模型。官方 ModelScope 页面已经出现发布预告,但截至8月25日,模型权重、许可证、上下文长度、基准成绩和服务价格仍未完整公开。
这次更新真正值得关注的不是“又一个百亿参数模型”,而是 Qwen 正在把旗舰模型的能力继续压进 Flash 档位。125B-A6B 意味着模型拥有1250亿参数的知识容量,却不必在每次生成时调用全部参数;如果路由和部署优化到位,它有机会在接近中型模型的计算预算下,提供明显更强的推理、编程和智能体能力。

目前确认了什么:125B 总参数,每次激活约 6B
Qwen3.8-Flash-Next 是一款面向高效推理的稀疏 MoE 大模型。“125B-A6B”中的125B代表总参数规模约1250亿,A6B代表处理单个 Token 时参与主要计算的参数约为60亿;后者通常比总参数量更能反映生成阶段的算力需求。
**MoE(Mixture of Experts,混合专家)是一种按输入动态选择部分参数参与计算的模型架构。**它把前馈网络拆成多个“专家”,再由路由器为不同 Token 分配专家,因此模型可以扩大总容量,而不必让全部参数在每一步都工作。
**激活参数是单个 Token 前向计算时实际参与运算的参数规模。**按照125B与6B的标称数字计算,Qwen3.8-Flash-Next每次只激活约总参数的 4.8%,总参数与激活参数之比约为 20.8:1。这是一种相当激进的稀疏度,但并不意味着推理成本严格等同于一款6B稠密模型,因为注意力层、共享专家、路由计算和跨设备通信仍会产生额外开销。
**截至8月25日,官方尚未给出完整模型卡。**目前不能确认的关键信息包括专家总数、每个 Token 选择多少个专家、是否包含共享专家、上下文窗口、原生量化方案、多模态能力、思考模式、许可证以及首批支持的推理框架。所谓“明日发布”现阶段更准确地说是发布预告,而不是已经完成权重交付。
它不是上一代80B-A3B的简单放大
**Qwen3.8-Flash-Next最直接的参照物是Qwen3-Next-80B-A3B。**上一代 Next 模型总参数为80B,每个 Token 激活约3B;新模型把总参数提高到125B,增幅为 56.25%,同时把激活参数从3B提高到6B,增幅为 100%。
| 模型 | 发布时间/状态 | 总参数 | 每Token激活参数 | 标称激活占比 | 上下文 | 已知定位 | |---|---:|---:|---:|---:|---:|---| | Qwen3-Next-80B-A3B | 已发布 | 80B | 3B | 3.75% | 最高约262K | 高稀疏MoE、长上下文、高吞吐 | | Qwen3.8-Flash-Next | 预计2026年8月26日 | 125B | 6B | 4.8% | 尚未公布 | Flash档高效推理模型 | | Qwen3.8-Max | 2026年8月已上线 | 2.4T | 95B | 约3.96% | 1M | 多模态旗舰、编程与复杂智能体 |
**新模型的计算量大概率会高于80B-A3B,而不是天然更快。**Qwen3.8-Flash-Next的激活参数翻了一倍,意味着单步计算预算显著增加;它能否保持“Flash”应有的速度,要看混合注意力、专家并行、量化精度、推测解码和底层算子能否抵消这部分增量。
**新模型的价值更可能来自容量与质量的平衡。**125B总参数为不同领域专家留下了更大的知识空间,6B激活规模则让模型有机会改善复杂指令、代码生成和工具调用中的稳定性。换句话说,它不像3B激活模型那样极端追求便宜,也没有走95B激活旗舰模型的高成本路线,而是试图卡在大规模生产部署更容易接受的位置。
“Next”可能代表架构路线,但不能直接等同于上一代
**Qwen3-Next是一套围绕长上下文和低延迟设计的混合架构。**已发布的Qwen3-Next-80B-A3B采用48层网络,并按“三层线性注意力加一层传统注意力”的节奏组织模块,以降低长序列处理中的计算和缓存压力。
**混合注意力是在线性注意力与传统全注意力之间进行分层组合的架构。**传统注意力更擅长精确建模任意 Token 之间的关系,但计算和显存开销会随序列长度快速增长;线性注意力则通过压缩或递推状态处理序列,让长文本成本更接近线性增长。
**上一代Qwen3-Next使用Gated Delta Networks处理大部分序列信息。**这类网络可以把上下文压缩进持续更新的状态中,适合长文档、长对话和持续工具调用;周期性插入的分组查询注意力,则用于补足线性结构在精确检索和远距离关联上的短板。
**Qwen3.8-Flash-Next是否完整继承这一结构仍需等待模型卡确认。**名称中的“Next”强烈暗示它延续高稀疏MoE和混合注意力路线,但不能仅凭命名断言其专家数量、注意力比例或上下文长度与80B-A3B完全一致。尤其是125B-A6B已经改变了容量和计算预算,Qwen团队可能同步调整专家粒度、路由策略与层数。
**MTP(Multi-Token Prediction,多Token预测)是另一项可能影响速度的关键技术。**MTP让模型在一次前向过程中预测后续多个位置,可用于提高训练效率,也可配合推测解码减少串行生成步骤;但Qwen3.8-Flash-Next是否启用MTP、实际接受率是多少,目前均未公布。
125B-A6B不等于“6B模型塞进一张显卡”
**MoE降低的是活跃计算量,不会自动消除权重存储成本。**即使每次只使用约6B参数,部署节点通常仍需保存或访问完整125B权重,以便路由器随时调用不同专家。
**125B权重的理论存储量依然不小。**仅按参数本身估算,BF16精度约需 250GB,FP8约需 125GB,4-bit量化约需 62.5GB;这些数字还没有计入量化比例因子、KV Cache、路由缓存、运行时工作区和框架开销。因此,它更像面向多卡服务器和云端集群的高效大模型,而不是普通消费级显卡上的本地模型。
**专家通信可能成为Qwen3.8-Flash-Next的实际瓶颈。**当专家分布在不同GPU上时,路由器需要把Token



