行业快讯
昇腾RL训推对齐,性能最高增60%
2026-08-06T10:02:21.135Z

华为昇腾补齐强化学习训推一致能力:Qwen3-30B MoE测试实现Logdiff为0,并在Eager模式下取得20%-60%的性能收益。
昇腾RL训推对齐,性能最高增60%
华为昇腾在 8 月 5 日宣布支持强化学习训推一致性,并在 Qwen3-30B MoE 模型测试中实现 Logdiff 为 0。根据华为计算披露的数据,昇腾还通过面向自身硬件优化的 FA 算子,在 Eager 模式下获得了 20%-60% 的性能收益。
强化学习后训练是利用奖励信号继续优化大模型行为的训练阶段,常见算法包括 PPO、GRPO 及其衍生方案。随着推理模型、智能体和代码模型越来越依赖可验证奖励,强化学习已经从模型能力冲刺手段,逐渐变成大模型工程化训练的基础环节。
训推一致性是指训练引擎与负责生成样本的推理引擎,在相同权重和相同 Token 序列下给出一致的数值结果。它听起来像一个精度问题,实际牵涉算子实现、并行切分、集合通信和混合精度策略,是一项从框架一直延伸到芯片内核的



