Dust:Transformer训练不再靠反传

QLabs 近日公布 Dust 研究,探索在不依赖反向传播的情况下预训练 Transformer。它暂时不是一个可直接替代主流训练栈的模型,而是一次针对大模型优化底层假设的实验。
Dust:Transformer 训练不再靠反向传播,靠谱吗?
QLabs 近日公布了 Dust 研究,核心目标是探索一种不依赖反向传播预训练 Transformer 的方法。换句话说,研究者试图绕开当前大语言模型训练中最核心、也最昂贵的环节:把损失函数沿着数十层甚至数百层网络反向传递,再计算每个参数的梯度。
这不是又一个换了名字的 Transformer 变体,也不是一个已经可以下载使用的新模型。Dust 更准确的定位,是对大模型训练范式的一次底层试探:如果模型仍然需要通过前向计算理解输入、预测下一个词元,但不再依赖标准反向传播更新参数,训练效率、硬件要求和模型扩展路径会不会发生变化?
截至 2026 年 10 月 5 日,Dust 公开资料仍应被看作研究原型,而不是成熟的生产级训练方案。它最值得关注的地方,不是已经证明了反向传播可以被全面淘汰,而是把一个长期被默认的前提重新摆到了台面上:Transformer 的能力增长,是否必须绑定在梯度、显存和反向计算这套组合上?

先说结论:方向有价值,现阶段还不能替代主流训练
Dust 的核心判断是,反向传播不是 Transformer 能学习语言规律的唯一途径。反向传播是一种根据损失函数计算参数梯度,并利用梯度更新神经网络参数的训练方法;它通常需要保存前向传播中的大量中间激活,因此会带来显著的显存和通信开销。
标准的大语言模型预训练大致分为三步:模型读取一段文本,前向计算下一个词元的概率分布;系统把预测结果和真实词元比较,得到交叉熵损失;随后通过反向传播计算每一层参数应该如何调整。
其中,真正昂贵的部分并不只是前向推理。为了在反向阶段计算梯度,训练系统通常必须保存或重算中间激活。模型层数越深、上下文越长、批次越大,激活占用越高;在多卡训练中,梯度同步又会引入额外的通信成本。这也是为什么大模型训练越来越依赖显存更大的加速卡、激活重计算、张量并行、流水线并行和复杂的通信调度。
Dust 探索的价值,在于它可能从优化算法层面减少对这套训练基础设施的依赖。假如参数更新不需要完整地穿过网络反向计算,理论上就有机会降低激活保存、梯度存储和跨设备同步的成本。
但这句话不能被简化为 Dust 已经让训练成本下降了多少。公开材料目前没有给出足以与 GPT、Llama、Qwen 或其他主流预训练体系直接比较的完整规模化数据,也没有证明它已经在同等参数量、同等数据量和同等硬件预算下击败标准 AdamW 训练。因此,Dust 的判断应当是:它提出了值得验证的替代路径,而不是宣布反向传播已经过时。
它试图改变的,究竟是哪一层?
Dust 改变的重点是参数优化过程,而不是 Transformer 的基本计算结构。Transformer 是一种以自注意力机制为核心的神经网络架构,它通过 Query、Key 和 Value 计算序列中不同词元之间的关联,再利用前馈网络和残差连接逐层变换表示。
即使不使用反向传播,模型仍然需要完成前向计算。输入文本经过词元化、嵌入、位置编码和多层 Transformer 模块后,模型依然要输出下一个词元的概率分布。语言模型的基本训练目标也没有因此消失:给定前面的词元,尽可能准确地预测下一个词元。
真正被重新设计的是参数如何获得更新信号。标准训练会计算每个参数的偏导数,也就是损失函数对该参数的梯度,再沿着梯度下降方向调整参数。非反向传播方法则需要寻找其他办法回答同一个问题:当前这组参数应该朝哪个方向变化,才能让预测更好?
这类替代方法通常面临三种选择。第一类是利用参数扰动,通过比较参数发生小幅变化前后的损失差异,估计某个更新方向;第二类是利用局部学习规则,让每一层根据本地可获得的信息更新,而不要求完整的全局梯度;第三类是使用随机搜索、进化式优化或其他零阶优化方法,直接根据模型输出质量筛选更好的参数变化。
零阶优化是只使用函数值而不显式计算梯度的优化方法。它可以把模型看成一个黑盒:给定一组参数,运行一次前向计算并得到损失;再对参数做扰动,比较损失变化,据此估计哪些方向可能更优。
需要注意的是,Dust 的公开标题清楚表达了不依赖反向传播的目标,但不能据此把它自动等同于某一种具体的随机搜索或局部学习算法。研究方案的实现细节、参数更新规则、可扩展性和实验边界,应以项目页面后续公布的完整论文、代码和基准测试为准。
为什么这件事现在值得关注
大模型训练的瓶颈已经从单纯的算力不足,扩展到显存容量、设备互联、数据搬运和训练稳定性。反向传播本身并没有错,事实上它仍然是目前训练大规模神经网络最成熟、最有效的通用方法。但它对硬件和系统软件提出了很高要求。
以一个典型的 Transformer 训练步骤为例,系统不仅要完成矩阵乘法,还要保存注意力和前馈网络中的中间张量。序列长度增加一倍时,注意力相关计算和显存压力可能快速上升;模型从单卡扩展到数千张卡后,梯度同步和参数切分又成为主要开销来源。即使采用混合精度、梯度检查点和 ZeRO 等技术,训练系统依然要围绕反向传播组织内存和通信。
如果某种训练方法可以减少对中间激活的依赖,它可能带来几方面影响:
- 训练显存压力下降,使更大模型或更长上下文能够在较少设备上运行。
- 训练并行方式发生变化,部分任务可能更适合分层、异步或局部更新。
- 对硬件的要求从高带宽反向计算,转向更高效的前向评估和参数搜索。
- 小团队训练基础模型的门槛降低,不必完全复制超大规模集群的工程方案。
- 模型训练的容错方式改变,局部节点失败可能不再需要完整回滚整个反向计算图。
不过,减少反向传播开销并不等于总成本必然下降。零阶方法往往需要多次评估模型,局部更新也可能需要额外的同步或校正。如果一次有效更新需要几十次甚至更多前向计算,单步计算量可能反而上升。判断一项新训练范式是否真正有用,不能只看它有没有梯度,而要看达到同等验证损失需要多少总 FLOPs、多少 GPU 小时、多少显存和多少通信流量。
与主流训练方式相比,Dust 处于什么位置
目前最稳妥的比较方式,是把 Dust 看成一种训练机制探索,而不是把它和已经发布的语言模型直接排位。下表列出几种相关范式的差异。
| 训练范式 | 是否依赖反向传播 | 主要更新信号 | 优势 | 主要问题 | |---|---:|---|---|---| | 标准梯度训练 | 是 | 全局梯度 | 收敛成熟、计算效率高、适合大规模模型 | 激活显存高,依赖复杂并行与通信 | | 梯度检查点训练 | 是 | 全局梯度 | 降低激活显存 | 需要重复前向计算,训练速度可能下降 | | 零阶优化 | 否,通常不显式计算 | 参数扰动后的损失变化 | 不需要完整反向图,可处理部分黑盒目标 | 函数评估次数多,维度扩展困难 | | 局部学习规则 | 否,或弱化全局反向依赖 | 局部误差信号或局部状态 | 有潜力实现模块化、异步更新 | 跨层信用分配和长期依赖较难处理 | | Dust 探索 | 目标是不依赖反向传播 | 以项目公开实现为准 | 直接挑战 Transformer 预训练的既有假设 | 规模化效果、收敛速度和工程成本仍待验证 |
标准梯度训练的最大优势,是它能够把一个词元预测错误产生的损失,精确分配到前面数十层网络中的相关参数。这个过程被称为信用分配,也就是判断最终错误究竟由哪些参数和中间表示造成。
Dust 必须解决的核心问题,正是这种信用分配。语言模型不是只在最后一层做简单分类。一个错误的词元预测,可能与词嵌入、位置表示、注意力模式、前馈网络中的特征以及归一化状态同时有关。如果不使用反向传播,系统需要用更低成本的方式估计这些模块之间的责任关系,否则模型可能只能在较浅层或较小规模上工作。
最大难点:从小模型有效到大模型有效,中间隔着一整套工程
很多新训练算法在小型实验中能够运行,并不代表它能支撑真正的大模型预训练。参数规模从百万级扩大到十亿级、百亿级后,优化空间会急剧增大,随机扰动的信噪比下降,单次试探得到的损失变化也更难区分。
第一道难题是更新信号噪声。对于一个拥有数十亿参数的模型,随机改变一小部分参数,整体损失可能几乎不变;改变得太大,又容易破坏已经学到的表示。训练方法必须在探索新方向和保持已有能力之间找到平衡。
第二道难题是样本效率。标准反向传播一次前向加一次反向,就能为全模型的大量参数提供梯度信号。非反向传播方法如果需要通过多次试验比较不同参数状态,可能消耗更多训练样本和计算量。它在单步显存上更省,并不代表在达到相同困惑度时更省。
第三道难题是长上下文。语言模型的优势之一,是处理跨越很长距离的依赖关系。对于一段代码、一个多轮对话或一篇长文,模型需要知道前面信息如何影响后面的预测。局部更新如果只看短范围信号,可能很难学到跨层、跨位置的关系。
第四道难题是训练稳定性。主流 Transformer 已经形成了一套成熟的稳定化方案,包括 Pre-LN、RMSNorm、学习率预热、权重衰减、梯度裁剪和混合精度训练。换掉反向传播后,原有超参数经验未必继续有效,学习率也可能不再是唯一需要调节的关键变量。
第五道难题是硬件利用率。现代 AI 加速器擅长大规模矩阵乘法。标准训练可以把前向和反向计算组织成高吞吐的算子,而某些参数搜索或局部更新方法可能引入大量细碎、低并行度的计算。如果算法层面节省了显存,却让 GPU 利用率从 50% 降到 10%,最终训练成本未必更低。
这不是把大模型训练变成“只跑一遍前向”
一个常见误读是,Dust 取消了反向传播,因此训练时只需要进行前向推理。这种理解并不准确。模型依然需要反复读取训练数据、计算预测结果、评估损失并调整参数;只要参数在变化,训练就仍然是优化过程。
不依赖反向传播,通常只意味着系统不通过标准自动微分机制计算完整梯度。它不意味着没有损失函数,没有前向计算,也不意味着训练可以像部署一个聊天机器人一样简单。
对开发者来说,更重要的区别在于训练栈的组成可能改变。今天的预训练框架围绕计算图、自动微分、梯度累积、优化器状态和分布式梯度同步设计。若 Dust 一类方法成熟,未来训练框架可能需要更多支持参数扰动、局部状态、异步更新和黑盒评估的机制。
这也会影响模型调试。传统训练可以查看梯度范数、梯度爆炸、不同层的更新幅度和优化器状态;非反向传播方法则需要建立新的监控指标,例如扰动方向的有效性、局部损失变化、参数更新的方差和不同模块之间的协同程度。
对 AI 开发者意味着什么
短期内,Dust 对应用开发者的直接影响有限。它不是一个可以立刻替换现有推理模型的开源权重,也不是一个能让普通开发者马上低成本训练大模型的成熟工具链。当前更值得关注的是它可能影响基础模型供应链和训练基础设施,而不是聊天机器人产品今天的回答质量。
对模型研究者而言,Dust 提供了一个重要的研究问题:反向传播带来的优势究竟来自梯度本身,还是来自它高效地完成了全局信用分配?如果后者可以被其他机制近似,那么未来可能出现更模块化、更适合异构硬件的训练方式。
对训练基础设施团队而言,评价 Dust 不能只看论文中一个损失曲线。至少需要同时关注以下指标:
- 在相同参数量、数据量和上下文长度下,最终验证损失是否接近标准 AdamW 训练。
- 达到相同困惑度所需的总前向次数、总 FLOPs 和 GPU 小时。
- 在单卡、少卡和大规模集群上的扩展效率是否一致。
- 训练过程中显存峰值、通信量和故障恢复成本分别是多少。
- 模型在代码、数学、长上下文和多语言任务上的能力是否均衡。
- 非反向传播训练得到的模型能否继续进行监督微调、偏好优化和量化部署。
对于深度用户,最值得留意的是后续是否会出现可复现实验。一个真正有影响力的结果,应该至少公开模型规模、数据规模、训练 token 数、硬件型号、总训练时长、验证损失和与标准基线的对照,而不是只展示方法概念或小型样例。
现在该如何评价 Dust
Dust 的意义不在于它已经证明了另一种方法可以全面击败梯度下降,而在于它把训练大模型的基本假设重新拆开检查了一遍。过去几年,模型架构、数据配比和推理策略变化很快,但预训练阶段仍然高度依赖反向传播、AdamW 和大规模 GPU 集群。Dust 选择从优化机制动手,切入点足够底层,也足够冒险。
它的短期上限可能是成为一种适用于小模型、边缘设备或特定模块的训练方法。例如,部分模块可以通过局部规则更新,部分模块继续使用梯度训练;或者在资源受限场景中,用更高的计算次数换取更低的峰值显存。这样的混合训练路线,可能比完全取代反向传播更早落地。
它的长期价值则取决于能否解决规模化问题。只要 Dust 在十亿参数以上模型上仍然需要数量级更多的前向评估,或者模型质量明显落后于标准训练,它就很难成为主流预训练方案。相反,如果后续实验能够证明它在保持相近模型质量的同时,显著降低激活显存和跨卡通信,那么它可能推动训练框架、芯片调度和模型并行方式一起变化。
所以,今天对 Dust 最准确的判断是:这是一次有技术含量的训练范式探索,值得模型研究者持续跟踪,但还远没有到改写大模型训练规则的阶段。反向传播暂时不会因为一篇研究就退出舞台;不过,Transformer 训练不必永远只有这一条路,Dust 至少让这个问题重新变得可以被认真讨论。
参考来源
- Dust: Pretraining Transformers Without Backpropagation:QLabs 发布的 Dust 项目原始资料,介绍研究目标与核心方向。原始页面域名不在本文要求的国内可访问来源白名单内,因此仅在正文中作为项目名称说明,不纳入文末可访问链接列表。
- 大语言模型的预训练:基本概念原理、神经网络的语言模型、Transformer 模型原理详解:用于核对语言模型预训练、正向传播、反向传播和位置编码等基础概念。
- Transformer 架构解析:模型训练和反向传播:用于补充 Transformer 训练流程与反向传播机制的背景说明。
- 预训练大语言模型:用于参考语言模型预训练目标、模型规模化训练和 Transformer 解码器的相关背景。
- Transformers 快速入门:预训练大语言模型:用于核对自回归语言建模、前缀语言建模和中间填充任务的定义。



