华为开源盘古全套训练代码

华为今日宣布,openPangu-2.0 的预训练、SFT 与后训练 RL 代码正式开源。继 92B Flash 和 505B Pro 模型权重陆续开放后,华为这次把模型训练流程进一步推向公开,重点争夺昇腾生态的话语权。
华为开源盘古全套训练代码,昇腾生态开始补上最关键的一块
华为今天宣布,openPangu-2.0 的预训练代码、监督微调(SFT)代码和后训练强化学习(RL)代码正式开源上线。相关代码分别面向基础模型训练、指令对齐和能力增强三个阶段,开发者可以在昇腾环境中参考或复现盘古模型的训练流程。
这不是一次普通的模型权重发布。模型权重告诉开发者“已经训练好的模型是什么样”,训练代码则进一步回答“模型是怎么被训练出来的”。对于一家以昇腾 NPU 为核心的硬件与软件生态厂商来说,开放完整训练链路,意味着华为正在把 openPangu 从一个开源模型项目,推向一套面向昇腾的训练范式和工程样板。

这次到底开源了什么
**预训练是利用大规模无标注数据学习通用能力的阶段,模型在这一阶段建立语言理解、知识记忆和推理基础。**它通常需要处理数万亿 Token 的文本、代码或多模态数据,计算成本最高,也是最能体现硬件集群效率的环节。
**SFT,即监督微调,是使用人工整理的问答、指令和任务样本,让基础模型学会按照用户要求完成任务的训练阶段。**基础模型往往“知道很多”,但不一定会按格式回答、遵守指令或稳定完成工具调用,SFT 负责把通用能力转化为可交互能力。
**后训练 RL,即基于强化学习的后训练,是通过奖励模型、规则反馈或环境反馈继续优化模型行为的过程。**它通常用于改进复杂推理、数学、代码、工具使用和长链路任务表现,也是当前大模型从“能回答”走向“会解决问题”的关键阶段。
华为此次开放的核心内容包括:
- openPangu-2.0 预训练代码;
- openPangu-2.0 SFT 代码;
- openPangu-2.0 后训练 RL 代码;
- 与昇腾 NPU 训练和推理相关的工程实践;
- 此前已经陆续开放的模型权重、基础推理代码和部分训推算子。
官方开源仓库名称分别为 openPangu-2.0-Training 和 openPangu-2.0-RL。从仓库划分来看,华为把通用训练与强化学习后训练拆成了相对独立的工程模块,方便开发者理解不同阶段的依赖关系,也更符合实际训练集群的组织方式。
需要明确的是,代码开源不等于普通开发者可以低成本复现完整模型。openPangu-2.0 Pro 使用约 34 万亿 Tokens 的训练数据,总参数约 5050 亿,单个 Token 激活参数约 180 亿。完整复现这样的模型,仍然需要大规模 NPU 集群、数据工程能力、分布式训练经验以及持续数周甚至更长时间的计算资源。对大多数团队而言,代码的价值首先是学习和改造,而不是从零复刻 505B 模型。
openPangu-2.0 的模型底座并不轻
**MoE,即混合专家模型,是一种让不同参数子网络分别处理不同输入、每次只激活部分参数的模型架构。**openPangu-2.0 Pro 总参数约 505B,但每个 Token 激活的参数约为 18B,这意味着它可以拥有接近超大模型的参数容量,同时避免每次推理都计算全部参数。
| 模型 | 总参数量 | 单 Token 激活参数 | 上下文长度 | 训练数据规模 | 已开放内容 | |---|---:|---:|---:|---:|---| | openPangu-2.0-Flash | 约 92B | 参考资料未披露 | 512K | 参考资料未披露 | 模型权重、基础推理代码、训推算子 | | openPangu-2.0-Pro | 约 505B | 约 18B | 512K | 约 34T Tokens | 模型权重、基础推理代码、技术报告及训练代码陆续开放 |
**稀疏激活的核心价值,是让模型容量和单次计算量不再完全绑定。**可以把它理解成一家公司拥有数百个专家,但每个问题只安排其中十几位相关专家处理。这样做并不意味着计算成本很低,因为专家路由、通信、负载均衡和显存管理都会带来新的工程问题,但它为大模型在有限算力下提高容量提供了现实路径。
华为此前披露,openPangu-2.0 Pro 采用了 DSA 与 SWA 混合 Attention 架构,用于优化长文本场景;引入四支流 mHC 拓扑结构,以改善模型泛化表现;加入三头 MTP 自投机模块,提高推理阶段的生成效率;同时使用 Muon 优化器改善训练收敛效率。
这些名词的实际意义并不完全相同。DSA 与 SWA 主要对应注意力计算和长上下文处理,目标是让模型处理 512K 上下文时不至于线性堆高成本;MTP 通过一次预测多个后续 Token,为推理阶段的草稿生成和验证提供更高吞吐;Muon 则属于训练优化器层面的选择,影响模型收敛速度和训练稳定性。它们共同指向一个判断:华为在 openPangu-2.0 上关注的并不是单一榜单分数,而是训练效率、长上下文能力和实际部署吞吐之间的平衡。
这次开源的真正价值,在训练方法而不是“再多一个模型”
**完整训练代码的价值,是把模型开源从结果展示推进到过程透明。**过去很多开源模型主要开放权重、配置文件和推理脚本,开发者可以部署模型,却很难知道预训练数据如何组织、训练任务如何切换、SFT 样本如何拼接,以及 RL 阶段如何设计奖励和评估。
这对于研究机构和企业尤其重要。一个团队如果只拿到权重,通常只能在模型之上做提示词工程、知识库接入或参数高效微调;如果能看到完整训练流程,就有机会改动数据配比、训练策略、并行方式和后训练目标,进一步打造适合自身业务的模型版本。
从工程角度看,预训练、SFT 和 RL 的代码开放,还能帮助开发者观察三个容易被忽略的问题:
- **数据如何进入训练流程。**大模型训练的瓶颈并不只是数据量,还包括清洗、去重、质量打分、采样比例和不同语料的混合方式。代码如果提供数据处理接口,企业就能更清楚地评估如何接入自有代码、文档或行业语料。
- **分布式训练如何落到昇腾硬件上。**在超大规模模型中,数据并行、张量并行、流水线并行和专家并行之间的组合,会直接影响训练效率。昇腾原生实现的通信、算子和显存管理经验,是此次开源对硬件生态最有价值的部分。
- **后训练如何把能力转化为行为。**SFT 解决的是“按照示例回答”,RL 解决的是“在复杂目标下做出更优选择”。如果只开放模型权重而不开放奖励设计、采样流程和训练脚本,外部团队很难复用模型的能力对齐经验。
对高校实验室而言,openPangu-2.0 的代码可以作为国产 NPU 上的大模型训练案例;对企业而言,它更像是一套参考实现,帮助团队判断哪些部分可以直接使用,哪些部分必须根据数据规模和业务目标重写;对昇腾生态而言,训练代码的开放比单纯开放一个可下载模型更能降低开发者的迁移门槛。
华为正在兑现今年的开源路线图
**openPangu-2.0 的开源并不是一次性发布,而是从 2026 年 6 月 30 日开始分阶段开放七大组件。**6 月 30 日,华为率先开源了约 92B 参数的 openPangu-2.0 Flash,包括模型权重、基础推理代码和训推算子;7 月,约 505B 参数的 openPangu-2.0 Pro 模型权重、基础推理代码和技术报告上线;今天则进一步开放预训练、SFT 与后训练 RL 代码。
| 时间 | 开放内容 | 影响 | |---|---|---| | 2026 年 6 月 30 日 | openPangu-2.0 Flash 权重、基础推理代码、训推算子 | 开发者可以开始体验 92B 规模模型及昇腾推理链路 | | 2026 年 7 月 | openPangu-2.0 Pro 权重、基础推理代码、技术报告 | 505B MoE 模型和 512K 上下文方案进入公开阶段 | | 2026 年 9 月 28 日 | 预训练代码、SFT 代码、后训练 RL 代码 | 开源范围从模型结果扩展到完整训练流程 | | 2026 年下半年 | 计划继续开放更多组件 | 重点关注训练算子和其他工程模块的完善程度 |
这条路线的节奏很清楚:先让开发者获得模型,再逐步开放底层训练能力。它降低了项目初期的理解门槛,也让华为有时间整理不同模块的工程实现。不过,这种分阶段开放也意味着,开发者短期内未必能拿到一个完全独立、开箱即用的训练系统。不同仓库的版本、依赖和硬件环境是否匹配,需要实际使用后才能判断。
和主流开源模型相比,openPangu 的差异在哪里
**openPangu-2.0 的主要差异,不在于它单纯拥有更大的参数规模,而在于它把昇腾 NPU 作为训练和推理设计的一部分。**Llama、Qwen、DeepSeek、Mistral 等开源模型通常拥有更广泛的社区适配和第三方工具支持,开发者可以在 CUDA 生态、消费级 GPU 或云端 GPU 上快速部署;openPangu 则更强调国产算力上的原生优化。
这带来两个相反的结果。
一方面,昇腾用户可能获得更直接的参考路径。训练算子、通信优化和推理代码如果经过实际规模验证,企业不必完全依赖从 CUDA 方案迁移的间接经验。尤其是 MoE 模型中的专家并行和长上下文推理,对硬件通信和算子效率非常敏感,原生实现可能比通用适配更容易达到稳定吞吐。
另一方面,openPangu 的社区规模、第三方教程、工具兼容性和跨硬件可移植性,仍然需要时间积累。开源项目真正形成生态,依靠的不只是代码仓库,还包括 issue 响应、版本维护、训练复现记录、性能基线和第三方贡献。华为这次打开了训练代码,但是否能吸引足够多的外部团队参与验证,决定了它最终是“官方样例”,还是能成为广泛使用的基础设施。
| 对比维度 | openPangu-2.0 | 主流通用开源模型 | |---|---|---| | 硬件重点 | 昇腾 NPU 原生训练与推理 | 通常优先适配 CUDA GPU 生态 | | 公开范围 | 权重、推理代码、技术报告,并继续开放训练代码 | 取决于项目,部分只开源权重和推理代码 | | 模型形态 | Flash 与 Pro 两种规模,Pro 为大规模 MoE | 从中小规模稠密模型到 MoE 均有覆盖 | | 长上下文 | 官方披露支持 512K 上下文 | 不同模型差异较大 | | 社区成熟度 | 重点依赖昇腾开发者和国内产业用户扩展 | 国际社区、工具和第三方部署方案通常更多 | | 适合场景 | 国产算力适配、企业私有化研究、昇腾训练实践 | 跨硬件部署、快速实验、通用社区开发 |
开发者现在应该关注什么
**对开发者来说,今天最值得下载的不是模型文件,而是先阅读训练代码的硬件依赖、数据接口和版本说明。**如果你的团队已经使用昇腾 NPU,可以优先检查以下几个方面:
- 训练代码是否明确支持当前 CANN、驱动和通信库版本;
- 预训练、SFT、RL 三个阶段是否能够独立运行,还是必须依赖完整流水线;
- 数据格式、Tokenizer、检查点和断点续训机制是否有清晰说明;
- MoE 专家并行、数据并行和流水线并行是否提供可配置参数;
- 训练算子是否已经覆盖 Flash 与 Pro 两种模型规模;
- RL 阶段依赖哪些奖励模型、评估集或外部环境;
- 推理端是否能使用量化、连续批处理和长上下文优化。
没有昇腾集群的开发者,也并非完全没有价值。预训练和后训练代码仍然可以帮助研究人员理解工程结构、奖励设计和训练调度逻辑,但不要把它误解为可以直接在单张消费级显卡上复现 Pro 模型。对于资源有限的团队,更现实的路线是使用公开权重进行推理和参数高效微调,再从代码中提取数据处理、评估和后训练方法。
判断:这次开源补上了 openPangu 的关键短板
**openPangu-2.0 此前最明显的短板,是开发者能看到模型,却难以看到模型背后的训练方法;今天的代码开放正在补上这块短板。**如果华为能够持续维护仓库、公开可复现的性能数据,并把训练算子和硬件环境说明补齐,openPangu 有机会成为昇腾生态中最具代表性的开源大模型工程样板。
但它现在还不能被简单描述为“开源了一个 505B 模型,所以任何人都能训练盘古”。真正的门槛仍然包括算力规模、数据质量、分布式系统稳定性和后训练经验。完整训练代码降低的是知识门槛和工程试错成本,不会消除超大模型训练的资源门槛。
华为此次发布的战略意义也很明确:它不只是想让开发者在昇腾上运行一个模型,而是希望开发者按照昇腾的方式训练模型。对于国产算力生态来说,这比单次模型发布更重要;对于开发者来说,最终评价标准则很实际:代码能否跑通,性能能否复现,工具链能否稳定,社区能否持续维护。
截至 2026 年 9 月 28 日,openPangu-2.0 已经从模型权重开放,推进到预训练、SFT 和 RL 训练链路开放。接下来,开发者真正需要等待的不是又一个参数规模,而是更多可验证的训练结果、硬件性能数据和第三方复现报告。只有这些内容补齐,openPangu 才能从“华为的开源项目”变成“开发者愿意长期依赖的基础设施”。
参考来源
- IT之家:华为开源盘古 openPangu-2.0 的预训练、SFT 代码和后训练 RL 代码 —— 2026 年 9 月 28 日发布的本次开源消息及仓库信息。
- IT之家:华为 openPangu-2.0-Pro 模型及技术报告开源 —— 关于 505B 参数、18B 激活参数、512K 上下文和 34T Tokens 训练数据等背景信息的报道入口。
- IT之家:openPangu-2.0-Flash 模型开源 —— 关于 2026 年 6 月 30 日 Flash 版本首批开放内容的报道入口。


