华为开源5050亿参数盘古Pro

华为正式开源openPangu-2.0-Pro权重、基础推理代码及技术报告,以505B总参数、18B激活参数和512K上下文强化昇腾原生模型生态。
华为开源5050亿参数盘古Pro
华为在7月31日正式开源openPangu-2.0-Pro的模型权重、基础推理代码及技术报告。这是一款在昇腾NPU上完成训练的505B混合专家语言模型,每个token激活约18B参数,支持512K上下文,预训练数据规模约34T tokens。
这次发布兑现了华为在HDC 2026上的时间表,但也需要先划清开源边界:截至目前,openPangu-2.0-Pro开放的是权重、基础推理代码和技术报告,并不等于完整训练体系已经一次性全部交付。华为此前宣布从6月30日起陆续开放7大组件,包括预训练代码、后训练代码和训练算子,剩余部分仍要等待后续上线。

505B只是总规模,18B才更接近单次计算量
混合专家模型(Mixture of Experts,MoE)是一种只为每个token选择部分专家网络参与计算的稀疏模型架构。openPangu-2.0-Pro拥有约505B总参数,但每处理一个token只激活约18B参数,激活比例约为3.56%,总参数与激活参数之比约为28∶1。
这个数字说明openPangu-2.0-Pro不是用505B参数做一次完整的稠密计算。模型可以把更多知识容量分散在不同专家中,再由路由机制按照输入内容选择部分专家,从而把单token计算量控制在更接近18B稠密模型的区间。
但18B激活参数不等于只需要加载18B参数。MoE推理仍然需要保存、调度或者分布式加载505B总权重,显存容量、专家并行、卡间通信和路由负载均衡依然是部署难点。若仅做理论估算,505B参数以BF16保存约需1.01TB空间,以8位格式保存也约需505GB,这还没有计算KV Cache、激活值、运行时缓存和框架开销。
因此,openPangu-2.0-Pro更像一款面向集群和高吞吐服务的旗舰模型,而不是可以轻松塞进单张消费级显卡的本地模型。MoE降低的是每个token的主要计算成本,不会凭空消除大模型的存储和通信成本。
512K上下文的重点不是“塞得多”,而是“算得起”
上下文窗口是模型在一次任务中能够直接处理的token总量。openPangu-2.0-Pro支持512K上下文,适合长代码库分析、跨文档检索、超长报告总结、连续Agent轨迹以及大规模日志诊断等任务。
超长上下文真正困难的部分是注意力计算和KV Cache成本。传统全局注意力会让计算量随序列长度呈平方级增长,窗口从128K扩大到512K并不只是扩大4倍;如果所有token彼此进行完整注意力计算,注意力矩阵的理论规模会扩大16倍。
openPangu-2.0-Pro采用MLA,并进一步组合DSA与SWA两类注意力层。MLA是通过压缩键值表示来降低KV Cache开销的注意力机制;SWA是让token优先关注局部滑动窗口的注意力机制;DSA则负责从长序列中进行稀疏的全局信息聚合。
华为给出的DSA与SWA层配比为1∶2,也就是用更多SWA层处理局部依赖,再周期性地通过DSA层交换全局信息。这类似于先在每个章节内部阅读,再由少量全局层串联跨章节线索,而不是让一本书里的每句话都与其他所有句子逐一比较。
这种混合设计的价值非常直接:多数自然语言、代码和Agent轨迹都具有明显的局部连续性,没有必要在每一层执行完整全局注意力。它能否在512K长度下稳定找回早期细节,还需要长文本检索、跨段推理和真实代码仓库任务验证;“支持512K输入”与“能有效利用全部512K信息”并不是同一个指标。
四支流mHC试图改造模型内部的信息高速公路
mHC是openPangu-2.0-Pro用于替代传统单一路径残差连接的多支流拓扑架构。该模型使用4支流设计,让中间表征能够沿多条通路传播和组合,以提高表征多样性与泛化能力。
传统Transformer通常把每层输出加回同一条残差主干,结构稳定、训练成熟,但信息长期沿单一路径累积。四支流mHC更像把单车道升级为四车道,不同支流可以保存不同类型的特征,再在受约束的连接中完成交换。
这项改动比单纯增加参数更值得关注,因为它触及Transformer的基础拓扑。它的实际收益不能只看最终榜单,还应观察训练稳定性、不同任务的增益一致性,以及推理框架是否需要为四支流状态付出额外显存和算子调度成本。
三头MTP是推理加速器,但不等于速度直接翻三倍
多token预测(Multi-Token Prediction,MTP)是让模型一次额外预测多个未来token的机制。openPangu-2.0-Pro采用3头MTP架构,可额外提出3个候选token,用于减少逐token自回归生成带来的串行等待。
自回归模型的传统生成方式像一个人每写完一个字都重新阅读全文,再决定下一个字。MTP则会一次提前猜测后续多个token,主模型验证通过后可以批量接受,从而提升解码吞吐率。
不过,3头MTP不代表输出速度固定提升3倍。实际收益取决于候选token接受率、输出内容的不确定性、batch大小、服务框架调度和昇腾推理算子的融合程度。格式固定、重复度较高的内容通常更容易命中;创意写作、复杂推理和频繁转折的内容可能有更低的接受率。
华为还在训练中采用Muon优化器。Muon是一类针对神经网络矩阵参数更新进行设计的优化方法,目标是在大规模训练中改善更新方向和收敛效率,但其价值最终应落到训练曲线、算力消耗和同等数据预算下的模型质量,而不能只用“收敛更快”概括。
34T tokens之后,华为用在线蒸馏完成能力合一
训练数据规模决定模型见过的信息广度,但不直接等于能力上限。openPangu-2.0-Pro使用约34T tokens训练,这一数字已经进入超大规模预训练区间,数据清洗、去重、配比和高质量样本占比会比单纯增加token数量更关键。
后训练阶段采用了快慢合一微调、多专项强化学习和在线蒸馏。监督微调(SFT)是使用高质量指令与答案样本塑造模型行为的训练方法;强化学习(RL)是依据奖励信号继续优化模型策略的方法;在线蒸馏(OPD)则是在训练过程中动态吸收更强策略或教师信号的能力迁移机制。
所谓“快慢合一”,可以理解为让模型兼顾直接作答与深度推理两种工作方式。简单问答、信息抽取和格式转换不需要为长推理链支付全部延迟,数学、代码和复杂规划任务则需要更多推理预算。对开发者来说,这种能力只有在模型能够可靠判断何时快答、何时深思时才真正有用,否则只是把速度与质量的选择成本转移给用户。
Pro与Flash不是简单的大杯和小杯
openPangu-2.0是华为面向昇腾生态推出的开源模型系列。华为已在6月30日开放openPangu-2.0-Flash,并在7月31日开放Pro版本,两者都支持512K上下文,但参数容量和每token计算量差异明显。
| 项目 | openPangu-2.0-Pro | openPangu-2.0-Flash | |---|---:|---:| | 总参数量 | 505B(5050亿) | 92B(920亿) | | 每token激活参数量 | 18B(180亿) | 6B(60亿) | | 参数激活比例 | 约3.56% | 约6.52% | | 上下文长度 | 512K | 512K | | 训练数据量 | 约34T tokens | 官方已公开材料未列明 | | 定位 | 能力上限、集群部署 | 低时延、较轻量部署 | | 已开放内容 | 权重、基础推理代码、技术报告 | 权重、基础推理代码、训推算子 | | 开放时间 | 2026年7月31日 | 2026年6月30日 |
Pro的总参数是Flash的约5.49倍,但激活参数仅为Flash的3倍。这说明华为没有简单地按比例放大每次计算量,而是把更多增量放在专家容量中,试图用更稀疏的方式扩大知识与任务覆盖面。
Flash仍然是多数团队更现实的起点。92B总参数同样不算小,但权重存储、专家调度和集群规模都明显低于505B;Pro则更适合验证昇腾集群上的旗舰能力、长上下文吞吐和大规模Agent服务。
“昇腾原生”才是这次开源的战略重点
昇腾原生模型是从训练、算子、并行策略到推理路径都围绕昇腾NPU设计和优化的模型。openPangu并不只是把一个已有GPU模型转换格式后放到昇腾上运行,而是试图把模型架构与硬件特征共同设计。
华为此前宣称,openPangu 2.0在昇腾上的单卡吞吐率可达到其他主流开源模型的2倍。这个数据目前更适合作为官方性能目标,而不是无条件成立的横向结论,因为模型名称、输入输出长度、精度格式、batch大小、并行方式和测试软件版本都会显著影响吞吐结果。
开发者判断这项主张时,至少要关注以下条件:
- 对比模型是否具有接近的激活参数量与输出质量;
- 首token延迟和持续解码吞吐是否分别报告;
- 512K长上下文下是否包含KV Cache与卡间通信开销;
- MTP加速是否使用相同的候选接受标准;
- 测试是否给出NPU型号、节点数量、精度格式和并发规模。
缺少这些测试条件,“2倍吞吐”很难跨平台复现。对企业部署而言,每瓦吞吐、每节点并发、长上下文显存占用和稳定运行时间,往往比单一峰值tokens/s更重要。
这次开源补的是昇腾生态的“标准答案”
openPangu-2.0-Pro的主要意义不是再增加一个500B级模型名称,而是为昇腾提供一套原生MoE与长上下文实践。国内模型团队此前可以在昇腾上做迁移和适配,但缺少大型原生模型作为架构、算子和并行策略的共同参照。
华为也没有回避算力约束。余承东在HDC 2026期间表示,华为大量算力用于支持国内其他企业需求,自留算力数量有限,因此会更关注时延和吞吐率,而不是单纯把总参数继续推高。这解释了505B总参数、18B激活参数、混合注意力和MTP为何同时出现:它们都在围绕有限算力下的有效容量与服务效率做文章。
这条路线是务实的,但开源生态能否建立起来仍取决于后续组件。只有权重和基础推理代码,可以帮助用户运行与评测模型;只有预训练代码、后训练代码、训练算子、数据配方说明和完整复现实验陆续到位,社区才有可能真正修改、续训和验证这套架构。
现阶段最值得验证的四件事
openPangu-2.0-Pro已经具备有吸引力的纸面规格,但模型质量仍需可复现评测支撑。当前最值得开发者关注的是以下四个问题:
- 512K是否真正可用。 需要观察长文档问答、针测试验、跨章节推理和大型代码仓库理解,而不只是能否完成输入。
- 18B激活是否兑现质量优势。 应与相近激活计算量的MoE模型比较知识、代码、数学和Agent任务,而不是只按505B总参数分组。
- 昇腾吞吐优势能否复现。 官方所称2倍单卡吞吐需要完整测试配置、软件版本和端到端服务数据。
- 开源范围是否持续扩大。 预训练代码、后训练代码与训练算子的开放程度,将决定它是一款可下载模型,还是一套可研究、可修改的技术体系。
判断:规格够强,生态价值大于榜单意义
openPangu-2.0-Pro是一款明显围绕昇腾效率设计的超大规模MoE模型。505B总参数负责扩展容量,18B激活参数控制单token计算,DSA与SWA混合注意力降低长序列成本,四支流mHC改造信息通路,3头MTP则直接瞄准解码速度。
这套组合比单纯强调参数规模更有价值。它反映出华为在算力资源有限的情况下,把重点放在稀疏化、长上下文效率、硬件协同和推理吞吐,而不是继续参加没有边界的参数竞赛。
不过,openPangu-2.0-Pro目前还不能仅凭505B、512K和官方吞吐主张被判定为最强开源模型。真正决定其行业位置的,将是公开基准中的质量表现、昇腾集群上的实际部署成本、超长上下文可靠性,以及华为能否按计划补齐训练链路。
至少在2026年7月31日这个节点上,华为已经把昇腾原生旗舰模型从发布会带到了可下载、可运行、可审视的阶段。对于正在建设国产算力栈的团队,这比再多一个闭源演示更实际。
参考来源
- IT之家:华为盘古openPangu-2.0-Pro模型及技术报告开源上线——介绍Pro版本的开源时间、参数规模、训练数据、模型架构及后续组件计划。
- IT之家相关报道页面——汇总华为HDC 2026公布的openPangu 2.0开放节奏与昇腾原生定位。



