AI 快讯Agentic扩散模型闯入智能体
模型上新

Agentic扩散模型闯入智能体

2026-07-28T06:03:43.380Z
Agentic扩散模型闯入智能体

首个面向长程智能体任务的扩散语言模型近日亮相,支持128K上下文,并通过迭代去噪实现边行动边纠错。但在速度、成本和公开评测补齐前,它还谈不上取代自回归模型。

Agentic扩散模型闯入智能体

近日,一款被称为“全球首个 Agentic 扩散模型”的新模型亮相,首次把扩散语言模型推进到长程智能体任务,并将上下文窗口扩展到 128K token。它最值得关注的地方不是又多了一个长上下文模型,而是试图改变智能体的推理方式:模型不再只能从左向右追加下一步,而是可以在执行过程中重新审视已有计划,遮蔽低置信度内容,再对局部或全局进行修正。

**Agentic 扩散模型是以扩散式迭代去噪完成规划、工具调用与结果修订的智能体模型。**与主要面向文本续写的扩散语言模型相比,它必须处理环境反馈、动作选择、工具返回和长期目标,因此难度更高;与传统自回归 Agent 相比,它的理论优势是能修改已经生成的中间状态,而不必把错误一路带到任务末尾。

这次发布由量子位在 2026 年 7 月率先报道,但截至 7 月 28 日,现有公开材料尚未完整披露模型参数量、训练 token 数、推理硬件、单位任务成本及全部原始评测日志。因而,“全球首个”和“追平自回归”目前更适合视为发布方对技术定位的概括,而不是已经由第三方充分验证的行业结论。

Agentic扩散模型在128K上下文中进行规划、执行、获取反馈并重新掩码纠错的流程示意图

真正的新意,是把“改答案”放进生成过程

**扩散语言模型是通过反复预测并消除离散文本中的噪声或掩码,逐步得到完整序列的语言模型。**如果把自回归模型比作一名只能不断往后写的作者,那么扩散语言模型更像一名拿着整篇草稿反复修改的编辑:它可以先搭结构,再补细节,也可以删除前面不成立的判断后重新生成。

**自回归语言模型是按照 token 顺序预测下一个 token 的生成模型。**GPT、Llama、Qwen、DeepSeek 等主流大模型大多采用这一范式,其优势是训练体系成熟、KV Cache 高效、流式输出自然,而且每一步只需处理新增 token;缺点也很明确,一旦早期推理走错,后续内容往往会在错误前提上继续展开。

**主动重掩码是模型将低置信度或逻辑冲突位置重新替换为掩码,再进行新一轮生成的机制。**这一机制是本次 Agentic 扩散路线的关键,因为它让“反思”不再只是提示词要求模型再说一遍,而是进入模型自身的生成循环。模型可以发现某个工具返回与原假设冲突,然后重写计划中的相关步骤,而非机械地沿着旧计划继续调用工具。

传统 Agent 当然也能纠错,但通常依靠外部工作流完成。开发者会在模型外增加规划器、验证器、重试器和记忆模块,让一个自回归模型生成计划,再让另一个调用检查错误;如果失败,就把历史记录重新塞回上下文并要求重写。这个方案有效,却会造成上下文膨胀、重复计算和多轮调用延迟。

Agentic 扩散模型的野心,是把这套外部“脚手架”尽可能内化。它不是简单地让模型多采样几次,而是把计划草稿、已执行动作、环境反馈和待确认结论放进同一个可编辑状态中,通过多轮去噪更新其中的一部分。

128K上下文解决的是工作空间,不等于能力已经追平

**128K 上下文是指模型单次能够处理约 131,072 个 token 的输入与中间状态窗口。**按照中英文内容、分词器和代码占比不同,128K token 通常可以容纳数万到十余万汉字,或者一套中型代码仓库的关键文件、长篇研究资料和大量工具调用记录。

128K 对普通聊天已经明显过量,但对长程 Agent 恰好是刚需。一个深度研究任务可能包含几十篇材料、上百次检索结果、多版提纲和持续变化的证据关系;一个软件工程 Agent 可能需要同时查看需求、日志、测试结果、依赖文件和多轮补丁。窗口太短时,模型会不断压缩历史,而压缩本身就可能丢失决定性信息。

但“支持 128K”和“有效利用 128K”是两回事。长上下文评估需要至少回答四个问题:模型能否准确找回窗口中部的信息,能否识别跨越数万 token 的矛盾,能否在后段保持最初目标,以及在完整窗口下延迟和显存开销是否可接受。仅凭上下文长度,无法证明模型已经在真实 Agent 能力上追平顶级自回归模型。

目前可以确认和仍待披露的信息如下:

| 项目 | 本次 Agentic 扩散模型 | 当前公开状态 | 为什么重要 | |---|---:|---|---| | 上下文窗口 | 128K token | 已公开 | 决定可容纳的任务历史与工作区规模 | | 生成范式 | 迭代去噪、可重新掩码 | 已公开 | 决定模型能否原生修改早期结论 | | 面向任务 | 长程 Agent 规划与执行 | 已公开 | 区别于只做文本补全的扩散模型 | | 参数量 | 未披露 | 待补充 | 影响能力、显存和部署成本 | | 去噪步数 | 未披露 | 待补充 | 直接影响首 token 与总任务延迟 | | 训练规模 | 未披露 | 待补充 | 决定与同级自回归模型对比是否公平 | | 工具调用成功率 | 缺少完整原始结果 | 待第三方验证 | 衡量 Agent 是否真正可用 | | 128K端到端成本 | 未披露 | 待补充 | 决定能否进入生产环境 | | 权重与代码 | 公开状态尚不完整 | 待确认 | 决定社区能否复现“全球首个”结论 |

因此,标题中的“128K 追平自回归”需要更精确地理解:它首先意味着扩散模型在上下文规格上进入了主流长上下文区间,而不是意味着它在所有推理、代码、检索和工具使用基准上都与最强自回归模型打平。

扩散范式为什么更适合长程Agent

**长程 Agent 任务是需要跨越多轮观察、决策和执行,并持续维护目标状态的复杂任务。**这类任务最怕的不是某一句话写得不够漂亮,而是早期假设错误后,模型仍然投入大量调用成本执行一份已经失效的计划。

扩散模型的第一项潜在优势是全局规划。自回归模型通常先生成步骤一,再生成步骤二,后面的步骤只能建立在前文之上;扩散模型可以先得到一份低分辨率的整体方案,再逐轮补齐每一步的动作、条件和退出标准。这种“先画地图,再修道路”的方式更接近项目规划,而不是即时续写。

扩散模型的第二项潜在优势是局部修订。假设一个研究 Agent 原先认为某公司在 2025 年实现盈利,但新检索到的财报否定了这一点,自回归工作流往往需要重新生成整段报告;扩散式工作区则可以重掩码盈利判断、相关论据和结论段,保留没有受到影响的市场数据与产品分析。

扩散模型的第三项潜在优势是并行更新。自回归模型每次生成都存在严格的 token 依赖关系,而扩散模型理论上可以同时更新多个掩码位置。如果一个任务中有十个相互独立的资料空缺,扩散模型不必严格按照句子顺序逐个补齐。

扩散模型的第四项潜在优势是将不确定性显式化。低置信度位置可以保持掩码或被再次掩码,高置信度内容则提前固定,从而把更多计算分配给真正困难的部分。对于 Agent 来说,这比对整份计划平均投入计算更合理。

| 维度 | Agentic扩散模型 | 自回归Agent | 当前判断 | |---|---|---|---| | 生成方式 | 多轮去噪、整体或局部更新 | 从左向右逐 token 生成 | 扩散更适合反复修订 | | 早期错误处理 | 可重掩码后重写 | 通常依赖外部反思与重生成 | 扩散有结构性优势 | | 全局结构 | 可先生成粗略骨架再细化 | 通常边写边确定结构 | 扩散更自然 | | 流式响应 | 不一定天然连续 | 成熟且体验稳定 | 自回归占优 | | KV Cache | 非因果更新使复用更困难 | 复用机制成熟 | 自回归占优 | | 单步计算 | 可能并行生成多个位置 | 每步只计算新增位置 | 取决于实现和批量 | | 总推理轮数 | 需要多轮去噪 | 生成一遍即可结束 | 扩散存在“迭代税” | | 生产生态 | 仍在早期 | 推理框架与监控完善 | 自回归明显占优 |

最大障碍不是会不会纠错,而是纠错贵不贵

**迭代税是扩散模型为了多轮去噪而付出的额外计算与延迟成本。**图像扩散可以接受几十步生成,因为用户愿意等待一张高质量图片;Agent 却可能在每个工具调用前后都进行推理,如果每轮环境反馈都触发多次全局去噪,成本会迅速放大。

128K 会进一步放大这个问题。标准全注意力的理论复杂度随序列长度呈平方增长,将序列从 64K 扩到 128K,在其他条件不变的理想化分析中,注意力计算量可能增加到约 4 倍。实际系统可通过稀疏注意力、分块计算和局部更新降低开销,但发布方仍需要公开硬件、批量、去噪步数和端到端时延,才能说明 128K 不是一项只能跑演示的规格。

KV Cache 也是扩散模型必须补的工程课。自回归模型已经生成的 token 通常保持不变,因此对应的 Key 和 Value 可以缓存;扩散模型会在多轮中修改不同位置,缓存失效范围更大。如果每一步都重新计算完整 128K 序列,理论上的并行生成优势很容易被全局重算吞掉。

动态输出长度同样没有被彻底解决。自回归模型遇到 EOS token 就能停止,而扩散模型通常需要先决定待生成区域有多长。窗口设置过大,会出现无意义填充并浪费算力;窗口设置过小,又可能截断计划。Agent 场景还要处理动作数量动态变化,这比普通文本生成更麻烦。

所以,这款模型是否真的实用,接下来应该重点看五组数字:

  1. 首个有效动作延迟:从接收任务到发出第一次工具调用需要多少毫秒或秒。
  2. 每轮反馈修订延迟:工具返回后,模型局部更新计划需要多少时间。
  3. 平均去噪步数:简单任务和复杂任务分别需要几步,而不是只给最佳案例。
  4. 端到端任务成本:完成一次研究、编码或网页操作任务消耗多少计算资源。
  5. 长程任务成功率:必须在相同工具、上下文和预算下与自回归 Agent 对比。

“边行动边纠错”也可能只是更复杂的重试

**真正的在线纠错必须改变后续决策,而不只是改写已经生成的措辞。**如果模型发现工具调用失败后,只把原计划重新表述一次,这不构成 Agent 能力突破;只有当它能定位失败原因、撤销错误假设、保留有效状态并选择新动作时,扩散机制才真正发挥作用。

评测设计因此比模型口号更重要。研究团队需要区分文本层修订、计划层修订和世界状态修订:修正一个数字是文本层,改变检索路径是计划层,确认某个操作已经在真实环境执行则属于状态层。扩散模型在前两类问题上天然有优势,但第三类仍需可靠的外部状态管理,不能靠重新去噪“想象”动作已经完成。

安全问题也会随可编辑工作区出现新形态。传统自回归模型主要防范恶意提示影响后续输出,而扩散 Agent 还要防止工具返回污染全局草稿、攻击者诱导模型重掩码安全约束,以及长上下文中的局部恶意内容在多轮去噪后扩散到其他区域。扩散式纠错不是天然安全,它只是提供了新的修复接口,也带来了新的攻击面。

这不是自回归模型的终局,更可能是混合架构的起点

**混合生成架构是让扩散模型负责全局规划和修订,让自回归模型负责低延迟顺序执行的模型系统。**从当前工程条件看,这比“扩散全面替代自回归”更现实:扩散模块维护任务地图、证据关系和可编辑计划,自回归模块快速生成工具参数、代码片段和面向用户的流式回复。

这种分工可以避开两种范式各自的短板。扩散模型不必为每句话承担多轮全局去噪,自回归模型也不必独自维护几百步任务中的全部一致性;当新证据出现时,系统只让扩散模块修改受影响的计划区域,再把确定后的步骤交给自回归执行器。

本次发布最重要的意义,是证明扩散语言模型开始从“另类文本生成器”转向 Agent 的认知核心。此前扩散语言模型的卖点主要集中在并行生成和任意位置填充,这一次则进一步触及规划、行动、反馈和修订的闭环,应用目标明显更接近真实生产任务。

但现阶段还不宜把它称作自回归模型的替代者。128K 是一个必要的规格突破,主动重掩码也是值得下注的技术方向,可真正决定胜负的仍是每个成功任务所需的时间和成本。只要扩散模型在一次动作前需要反复扫描整个长序列,它的“会后悔”就可能比自回归模型的“先做再重试”更贵。

对于开发者而言,短期最值得关注的不是立刻迁移现有 Agent,而是观察模型能否开放可复现权重、完整轨迹和统一预算下的对比评测。只有当第三方能在软件工程、深度研究、浏览器操作和长周期决策任务中重复结果,Agentic 扩散模型才算真正跨过从论文机制到生产能力的门槛。

这场竞争最终比的也不是谁能一次写出最漂亮的答案,而是谁能在任务进行到第 80 步时发现第 3 步错了,并以最低成本把后面的世界重新接上。Agentic 扩散模型已经给出一种有吸引力的答案,但它还欠行业一张完整的性能账单。

参考来源

相关推荐

查看全部