AI 快讯循环Transformer,别只会重复计算
开发心得

循环Transformer,别只会重复计算

2026-09-13T03:05:58.002Z
循环Transformer,别只会重复计算

循环式 Transformer 正从“共享参数多算几轮”走向可分工、可变深度的架构。MeSH 与 SpiralFormer 的研究显示,循环次数、信息交接和序列粒度,决定了额外算力究竟是在推理,还是在空转。

循环 Transformer,别只会重复计算

截至 2026 年 9 月,Recurrent Looped Transformer(循环式 Transformer)正在从论文里的结构实验,变成大模型研究里一个越来越难绕开的方向。它的核心并不神秘:让同一组 Transformer 参数反复处理隐藏状态,用循环次数换取更深的有效计算。

但真正的问题也恰恰在这里:多算几轮,不等于多算出了东西。 如果每一轮都在用同样的方式处理同一份信息,模型只是在增加矩阵乘法次数,却没有获得与计算量匹配的新表达。近期围绕 MeSH、SpiralFormer、LoopFormer 以及循环深度推理的研究,正在把讨论从“循环结构有没有用”推进到“每一轮到底应该负责什么”。

普通 Transformer 与循环式 Transformer 的计算路径对比图,突出参数共享、隐藏状态更新和多轮 core loop

循环式 Transformer 是什么

循环式 Transformer 是一种重复调用同一组 Transformer 计算块、让隐藏状态在多轮迭代中持续更新的架构。 普通 Transformer 通常沿着固定深度从输入计算到输出,每一层的参数只在一次前向传播中使用;循环式 Transformer 则把部分层组织成 core loop,让同一组参数被重复调用。

可以把它类比成两种阅读方式。普通 Transformer 像是把稿件交给多位不同编辑,每人负责一遍;循环 Transformer 更像是同一个资深编辑连续审稿多轮。后者的优势是参数规模不必随计算深度线性增加,模型可以在相对有限的参数量下获得更长的计算轨迹;代价是同一个编辑如果没有明确分工,第二遍很可能只是把第一遍再看一遍。

这种结构同时改变了三个变量之间的关系:模型参数量、有效计算深度和推理时计算预算。传统扩容往往意味着增加层数或参数,而循环结构可以在参数规模基本不变的情况下,通过增加迭代次数延长计算路径。这给潜在推理、测试时计算和按任务难度分配算力留下了空间。

它为什么会吸引研究者

循环 Transformer 最直接的价值,是用参数共享降低“增加深度”的成本。对于需要多步变换、规划或抽象推理的任务,模型未必只需要更多记忆容量,也可能需要更多连续计算。循环结构提供了一种近似“让模型多想几步”的工程路径。

它还有一个部署层面的想象空间:简单问题少循环几次,复杂问题多循环几次。如果模型能够根据输入难度稳定地提前结束或继续计算,同一个模型就可能覆盖多个推理预算档位,而不必为每个档位准备一套独立模型。

不过,这种想象不能简单等同于把推理次数调大。每增加一次循环,Attention 和矩阵运算仍然要完整执行;如果后续循环的隐藏状态变化已经很小,延迟和算力成本仍在增长,但有效信息增量可能接近于零。

第一个瓶颈:循环很容易“空转”

循环空转是指后续迭代继续消耗计算资源,但隐藏状态和模型输出的有效变化快速变小。 补充研究资料中展示的 core loop 分析很直观:第一次循环带来的 hidden state 相对变化最大,后面几次变化迅速收窄。

这里有一个容易被误解的地方:柱子变矮,并不代表后续循环没有执行计算。相反,Attention、前馈网络以及相关矩阵运算照样运行,硬件仍然付出了完整成本。问题在于,模型已经没有充分利用这些计算去产生新的信息。

这种现象可以从三个角度观察:

  1. 隐藏状态变化幅度下降。 如果相邻循环的状态差异快速收敛,说明后续计算对当前表示的改写能力有限。
  2. 输出增益递减。 循环次数增加后,准确率或损失改善逐渐变小,计算投入与效果收益不再成比例。
  3. 表示空间变得单一。 奇异值谱分析显示,循环推进后,隐藏状态可能逐步挤进更低维的空间,原本可以从多个方向表达的信息被压缩到少数方向。

三个信号放在一起,解释了循环模型的“摸鱼”机制:第一轮完成主要的信息重组,后面几轮沿着相近的计算轨迹反复修补。它不是完全不工作,而是缺少足够的轮次差异,无法让每一轮承担新的职责。

为什么重复使用同一组参数会导致分工不足

计算无分化是指不同循环阶段使用相同或高度相似的计算方式,导致各轮难以形成稳定的功能分工。 普通深层网络中,不同层拥有不同参数,通常会自然形成从局部特征到抽象语义、从编码到决策的层次。循环 Transformer 共享参数后,这种天然的层间差异被削弱。

如果模型没有明确的轮次信号,它很难知道自己现在是第一次处理输入,还是已经完成了两轮加工。上一轮的 hidden state 整体交给下一轮后,同一组网络面对的输入形式也可能相当接近,于是最稳妥的策略就是重复已经学会的更新方式。

另一个问题是信息过载。同一份 hidden state 既要保留原始输入的关键信息,又要装入前几轮的中间结果,还要承担当前循环的临时计算。长期记忆、当前上下文和阶段性结果都挤在同一个容器里,后续循环自然更难判断什么应该保留、什么应该重算。

过去的一些做法会把初始状态重新注入每一轮,防止模型循环后忘记原始输入。这能缓解信息漂移,却没有真正解决交接问题:不管处于第几轮、处理哪个 token,信息的混合规则仍然相对固定。

MeSH:先解决每一轮“拿什么算”

MeSH 是一种面向循环信息交接的设计,核心目标是同时缓解计算无分化和信息过载。 根据资料,MeSH 论文首版于 2025 年 10 月公开,并已被 ICLR 2026 接收。它关注的不是简单增加循环次数,而是重新安排不同来源的信息如何进入下一轮计算。

从问题定义看,MeSH 试图把“原始输入”“当前循环结果”和“历史循环信息”区分开来。这样做的直觉类似于项目交接:下一位执行者不应该接收一张混在一起的便签,而应该知道哪些是原始需求、哪些是上一轮产出、哪些是待处理问题。

这类设计的关键价值,不一定体现在模型参数量骤降,而在于让额外计算更有方向。每一轮都可以获得与阶段相关的信息组合,模型也更容易学习到“第一轮先建立什么、第二轮再修正什么、最后一轮确认什么”的隐式流程。

MeSH 代表了一条重要思路:循环架构的重点不是把 hidden state 原封不动地传下去,而是设计更合理的状态交接协议。对于开发者来说,评估一个循环模型时,不能只看循环次数和最终准确率,还应该追踪每轮状态变化、信息保留比例和不同阶段的功能差异。

SpiralFormer:再解决每一轮“以什么尺度算”

SpiralFormer 是一种引入多分辨率处理的循环 Transformer,试图让不同循环阶段在全局与局部信息之间形成明确分工。 它的核心发现是,循环早期更适合建立 global pattern,随着循环推进,计算逐渐转向 local pattern。

这与人处理复杂文本的方式很像:第一遍先看文章主旨、人物关系和整体结构,后面再回到句子、词语和局部逻辑,检查细节是否成立。全程用同一种粒度扫完整 token 序列,并不会自动产生这种从全局到局部的流程。

资料显示,始终处理完整 token 序列的普通 LoopedFormer 虽然也会出现类似变化,但趋势更弱、稳定性也不足。换句话说,模型不会因为循环次数增加,就自动学会先宏观后微观;多分辨率设计才是推动这种分工出现的关键因素。

SpiralFormer 还带来一个值得关注的 Scaling 维度:除了调整循环次数,还可以调整每轮把序列压缩到什么尺度。循环次数回答“算几遍”,序列尺度回答“每一遍看得多细”。二者结合后,计算预算不再只有一个旋钮,而是变成深度与粒度的联合配置。

循环比例并非越高越好

在固定参数量和训练计算预算的条件下,循环层占比与模型效果通常呈现先升后降的 U 形或倒 U 形权衡,而不是循环越多越好。 资料中提到,当循环比例提升到约 30% 至 40% 时,SpiralFormer 的表现达到较优区间;继续增加循环,过度共享参数反而会拖累效果。

这个结果很关键,因为它否定了一个简单的工程直觉:把更多层改成共享循环层,就能免费获得更多推理深度。循环比例过低,模型得不到足够的迭代计算;循环比例过高,又会让参数多样性不足,所有阶段都被迫依赖相似的变换。

因此,循环架构的设计需要在“参数独立性”和“有效计算深度”之间找平衡。对于不同任务,这个平衡点可能不同:需要长链路推理的任务可能更依赖循环深度,需要丰富知识表征的任务则可能更依赖非共享层的容量。

MeSH 和 SpiralFormer,分别补上了哪块短板

MeSH 主要解决每轮“拿什么信息计算”,SpiralFormer 主要解决每轮“以什么粒度计算”。 两者并不是同一层面的替代方案,而是对循环 Transformer 两种缺陷的互补回答。

| 研究方向 | 主要问题 | 核心思路 | 可能带来的收益 | |---|---|---|---| | 基础 Looped Transformer | 参数共享但各轮分工不足 | 重复调用同一计算块 | 在较小参数量下增加有效深度 | | MeSH | 信息混在同一 hidden state 中 | 改善循环间的信息交接与组合 | 降低信息过载,增强阶段差异 | | SpiralFormer | 各轮处理粒度相近 | 引入多分辨率、从全局转向局部 | 让深度和序列尺度共同扩展 | | LoopFormer | 固定循环次数难适配预算 | 可变循环轨迹与一致性蒸馏 | 支持按预算弹性调整推理深度 |

这张表也说明,未来的循环模型不会只在“循环几次”上竞争。更重要的指标包括:每轮是否产生新信息、状态是否保持多样性、不同预算下性能是否平滑,以及循环提前停止后模型能否维持稳定输出。

LoopFormer:让推理深度变成可调旋钮

LoopFormer 是一种面向弹性推理的循环 Transformer,目标是在不同计算预算下平滑调整循环深度。 资料显示,LoopFormer 引入时间—步长联合调制与 shortcut-consistency 自蒸馏,使同一个模型能够在不同预算下改变推理轨迹。

固定迭代次数是循环模型走向实际部署的一大障碍。设置得太少,复杂任务没有足够计算;设置得太多,简单任务承担不必要的延迟。如果模型只能在训练时确定一个固定深度,循环架构“按难度分配算力”的优势就很难落地。

LoopFormer 的方向,是让模型学习不同循环预算之间的连续关系,而不是把每个循环次数当成彼此割裂的模式。理想情况下,预算缩减时性能不会突然崩溃,预算增加时效果也能持续改善。这比单纯追求某一个固定循环次数下的最高分,更接近真实产品需要的能力。

循环深度与隐式推理:优势不是“把思维链藏起来”这么简单

循环深度推理是指模型不依赖显式生成的中间文本,而通过多轮隐藏状态更新完成更长的内部计算轨迹。 这条路线近期受到关注,一部分原因是行业开始探索让模型进行更多内部计算,同时减少可直接读取的逐步推理文本。

但“不可见”不等于“更可靠”。显式思维链至少提供了可检查的中间痕迹,循环隐藏状态则更像一个无法直接阅读的草稿本。开发者如果只看最终答案,就很难判断模型是在逐步推理,还是在循环中重复激活相似表示。

因此,循环模型需要新的可观测性工具:每轮 hidden state 的变化曲线、注意力分布的迁移、奇异值谱变化、提前停止点以及不同预算下的错误类型,都应该成为评估的一部分。尤其在高风险场景中,不能因为最终准确率上升,就默认内部计算过程更可信。

这条路线和普通加深、MoE 有什么不同

循环 Transformer 的核心卖点是参数共享带来的计算深度扩展,而不是单纯增加模型宽度或专家数量。 普通加深通常为每一层配置独立参数,表达能力更强,但参数量、显存和训练成本也随深度增加。循环结构可以用同一套参数反复加工状态,参数效率更好,却更依赖轮次分工和状态管理。

MoE 则通过路由机制让不同 token 选择不同专家,重点是扩大参数容量并控制每个 token 的激活成本。循环 Transformer 更强调同一条计算轨迹的连续迭代。两者并不冲突:未来完全可能出现既有专家路由、又有循环深度的混合结构,但训练稳定性、路由与循环之间的耦合会更复杂。

| 架构 | 主要扩展维度 | 参数使用方式 | 典型风险 | |---|---|---|---| | 普通深层 Transformer | 层数与参数容量 | 每层参数独立使用 | 参数量和显存随深度增长 | | Looped Transformer | 有效计算深度 | 多轮共享同一组参数 | 后续循环空转、分工不足 | | MoE Transformer | 激活专家与总容量 | token 路由到部分专家 | 路由不均、训练与部署复杂 | | 多分辨率循环模型 | 深度与序列粒度 | 共享计算配合尺度变化 | 尺度设计和信息对齐困难 |

对开发者真正有用的结论

评估循环模型时,必须把“等参数”“等有效深度”和“等计算预算”分开比较。 如果只拿一个循环模型的最终分数与普通模型比较,很容易把更多计算误认为架构优势。严谨实验至少要回答三个问题:

  • 在参数量相同的情况下,循环模型是否更强?
  • 在总 FLOPs 或推理延迟相同的情况下,循环模型是否仍然更强?
  • 在有效深度相同的情况下,参数共享带来的表达损失是否可接受?

循环次数、循环比例和序列压缩尺度应该被当作三个独立超参数管理。 不能只设置一个 num_loops 就认为完成了架构设计。工程上还需要观察不同循环位置的状态变化,确认计算是否集中在第一轮,后续轮次是否真的承担了局部修正、关系整合或错误纠正。

循环模型的训练初始化和稳定性同样重要。 补充资料提到,相关循环架构会让训练开始时的每个迭代近似恒等映射,以降低隐藏状态在多次循环中爆炸或消失的风险。这类初始化策略并非细节,而是决定模型能否把循环次数真正训练起来的基础。

部署时应优先验证收益—延迟曲线,而不是只看最高准确率。 如果循环次数从 1 增加到 4,准确率只提升几个百分点,但延迟接近增加 4 倍,那么它是否值得部署取决于任务价值和服务预算。反过来,如果 LoopFormer 一类结构能够在预算减少时保持稳定性能,弹性深度可能比单点榜单成绩更有产品价值。

仍然没有解决的问题

循环 Transformer 目前最大的未解问题,是如何证明后续计算真的在产生新推理,而不是对相同表示进行低收益修补。hidden state 变化变小不一定代表无效,有些推理过程可能在接近答案时趋于收敛;但如果状态过早坍缩到低维空间,模型又可能失去表达复杂分支的能力。如何区分“有效收敛”和“计算空转”,需要更细的机制分析。

第二个问题是训练与推理的错配。训练时如果总是使用固定循环次数,模型可能不会适应提前退出;如果训练时随机改变循环次数,又可能牺牲最深路径的优化质量。可变深度、自蒸馏和一致性约束提供了方向,但还需要在更多规模、任务和硬件环境中验证。

第三个问题是可解释性。循环隐藏状态没有天然的文本化思维轨迹,开发者需要建立新的调试方式。未来模型评测不应只有最终准确率和平均延迟,还应包含循环利用率、状态多样性、预算弹性、早停可靠性和错误恢复能力。

OpenAI Hub 判断

循环 Transformer 值得关注,但它不是“把模型多跑几遍”就能获得推理能力的捷径。 这条路线真正有价值的部分,在于把模型参数、计算深度和推理预算拆开,让开发者可以用更细的方式配置模型。

MeSH 提醒行业,循环之间需要清晰的信息交接;SpiralFormer 说明,循环之间还需要不同的计算尺度;LoopFormer 则把问题推进到部署阶段:模型能不能根据预算和任务难度,稳定地决定自己要算几轮。三者共同指向一个结论——循环架构的竞争焦点不是“谁循环得更多”,而是“谁能让每一轮做不同且有用的工作”。

截至 2026 年 9 月,这仍是一条研究路线,而不是已经取代普通 Transformer 的成熟范式。对于开发者,最值得跟踪的信号不是某篇论文把循环次数推到多少,而是它能否在等计算预算下持续赢过非循环基线,能否解释每一轮的增量,能否在不同推理预算之间平滑伸缩。如果这些问题得到解决,循环 Transformer 才可能从架构实验,走向下一代高效大模型的基础组件。

参考来源

注:本文根据公开论文摘要、项目资料和补充研究信息整理。文中关于模型效果、循环比例和机制的判断,应结合论文原文中的具体实验设置、参数规模与计算预算解读。

相关推荐

查看全部