GLM-5.3让AI自建推理系统

智谱让GLM-5.3参与国产芯片推理栈建设,不到两周将GLM-5.3-Flash端到端吞吐提升至初始基线的3倍。这次突破的重点不是写代码,而是AI开始进入生产系统的性能闭环。
智谱在今天(2026年9月17日)披露了国内大模型厂商首个公开进入生产环境的递归自我改进案例:由GLM-5.3驱动的Infra Agent参与设计、调试和优化GLM-5.3-Flash的推理基础设施,并在超过10万张国产加速芯片组成的集群上完成生产级部署。
这套系统用不到两周时间,把GLM-5.3-Flash的端到端服务吞吐提升至初始基线的3倍。智谱还称,优化后的硬件利用效率和单Token成本已达到主流NVIDIA GPU的相当水平,相关系统已经承接真实外部流量,而不是停留在实验室压测阶段。

这次不是AI写几个算子,而是进入推理系统闭环
递归自我改进(Recursive Self-Improvement,RSI)是指AI参与改进承载自身训练或推理的软件与硬件系统,使模型能力和系统效率形成持续反馈循环。过去这个概念更多存在于研究讨论里,而智谱这次给出的版本更工程化:模型没有修改自身权重,而是帮助工程师优化运行自己的推理基础设施。
Infra Agent是面向基础设施工程任务的智能体,它能够读取代码、性能日志、监控指标和测试结果,再执行实现、编译、部署、压测与修正。它和普通编程助手的区别在于,后者通常停在“生成代码”,前者必须面对编译失败、算子精度、设备通信、显存溢出、尾延迟和线上稳定性等真实约束。
这项实践最值得关注的地方,是AI进入了“发现瓶颈—修改系统—运行测试—读取结果—继续优化”的完整闭环。推理基础设施不是一次性生成即可交付的软件,很多优化方案只有放到目标芯片、目标模型和真实请求分布下才能验证,因此Infra Agent的价值并不取决于它写了多少行代码,而取决于它能否缩短每轮实验的周期。
智谱目前披露的核心结果如下:
| 指标 | 初始基线 | Infra Agent参与优化后 | 说明 | |---|---:|---:|---| | 端到端服务吞吐 | 1.0 | 3.0 | 不到两周完成,提升200% | | 国产芯片集群规模 | 未披露 | 超过10万张 | 通过自研高带宽互联网络连接 | | 硬件利用效率 | 未披露 | 官方称与主流NVIDIA GPU相当 | 尚未公布统一口径的绝对数值 | | 单Token成本 | 未披露 | 官方称与主流NVIDIA GPU相当 | 未披露电价、折旧及利用率假设 | | 真实流量 | 无 | 6天超过62万亿Token | 覆盖OpenCode与OpenRouter等场景 | | 长上下文 | — | 最高约100万Token | 对显存、带宽和调度提出更高要求 |
“提升至3倍”意味着优化后吞吐是初始值的300%,而不是在原值上增加300%。换句话说,如果初始系统每秒能够处理100个相同口径的请求或Token工作单元,优化后约为300个;其提升幅度是200%。不过,智谱没有公布输入长度、输出长度、并发规模和服务等级目标,因此这一数字不能直接横向换算为其他厂商的Tokens/s。
十万卡国产集群,真正难的是把卡喂饱
国产加速芯片部署前沿模型的主要问题并不只是单卡峰值算力较低,而是内存容量、内存带宽、通信效率和软件生态会共同限制有效吞吐。模型推理就像一条流水线,只提高某个算子的速度没有意义;只要预填充、跨卡通信、KV缓存读取或请求调度中的任一环节堵塞,昂贵的计算单元就会等待。
GLM-5.3-Flash是一款采用混合专家架构的原生多模态模型,总参数量约3200亿,每次推理激活约180亿参数。它支持文本、图片、视频和文件输入,并提供约100万Token上下文,因此模型虽然以“Flash”命名,部署难度仍远高于普通的百亿参数稠密模型。
长上下文推理是这套系统最尖锐的压力来源。上下文从几万Token扩大到100万Token后,系统不仅要保存更多中间状态,还要在多卡、多节点之间频繁搬运数据;如果按常规方式堆显存,很快就会遇到容量和带宽上限。
智谱没有选择照搬CUDA生态中的既有实现,而是在开源推理框架SGLang之上构建了面向目标芯片的专用引擎。SGLang是面向大语言模型和多模态模型的高性能推理框架,提供请求调度、缓存管理、并行推理和服务化能力;它给出了通用底座,但设备算子、通信策略和部署拓扑仍需针对国产芯片重新适配。
EPD分离,把三种不同工作拆开调度
Encode–Prefill–Decode分离架构是把多模态编码、提示词预填充和逐Token解码拆成独立资源池的推理部署方式。智谱将其简称为EPD,使三个计算特征明显不同的阶段能够分别扩容和调度。
多模态编码阶段负责处理图片、视频等输入,计算密度高但不是每个请求都有;Prefill阶段一次性读取完整提示词,更偏向大矩阵计算;Decode阶段则每轮只生成少量Token,更依赖内存带宽和低延迟通信。把三者塞进同一组设备,容易出现GPU或加速卡在不同负载之间相互等待,而EPD可以让每类资源池按实时流量独立伸缩。
这种拆分的实际意义可以用晚高峰餐厅来理解。编码、预填充和解码分别类似备菜、集中烹饪和连续出餐,如果所有工序共用同一张操作台,任何长任务都会阻塞后续订单;把工作区拆开后,系统可以根据图片请求、长提示词和长输出的比例动态调整资源。
智谱披露的底层技术组合还包括节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化以及Layer Split。W8A8量化是把模型权重和激活值压缩到8位精度的推理技术,它能够减少存储占用和数据搬运量,但必须控制量化误差,避免代码生成、工具调用等高精度任务出现明显退化。
混合缓存量化则没有对所有数据采用同一种格式,而是根据不同层、不同状态和精度敏感度,在INT8、FP8和BF16之间取舍。这个思路本质上是“重要数据多花显存,不敏感数据多压缩”,比全局使用一种低精度格式更复杂,但更适合对质量敏感的生产服务。
Layer Split是把不同模型层拆分到不同设备或资源域执行的策略,其目标是绕开单卡内存限制并平衡各阶段负载。智谱还提到“以算力换带宽、以通信换显存”,这说明优化目标不是让每一个局部指标都最小,而是在芯片能力有限时主动交换资源,用更富余的计算或网络能力补偿内存瓶颈。
Infra Agent的贡献,应该理解为加速工程迭代
GLM-5.3在此次项目中承担的角色包括开发和优化算子、诊断性能瓶颈、改进部署服务栈,以及根据压测反馈继续修改方案。这些任务横跨模型结构、推理框架、编译工具、设备运行时和集群调度,传统上需要多个工程团队反复对齐。
两周把吞吐做到3倍,最可能的收益来自大量小优化的叠加,而不是某个单点算法突然带来三倍加速。算子融合可以减少内存读写,量化可以降低带宽压力,EPD可以提高集群利用率,调度优化可以减少气泡,缓存策略则能避免重复计算;只有这些环节同时改善,端到端吞吐才会显著上升。
这也意味着“AI自建推理系统”不能被理解为GLM-5.3完全脱离人类、独立操作十万卡集群。智谱的表述是Infra Agent大幅加速了工程建设,生产权限、性能目标、验收标准和上线决策仍然需要工程团队负责,因此更准确的说法是“人类定义边界,Agent执行高频迭代”。
真正可复制的能力也不是某次生成出的代码,而是评测与反馈环境。只有Agent能够稳定取得编译日志、单元测试、数值误差、性能剖析和线上监控数据,它才可能判断一次修改究竟改善了吞吐,还是用更高延迟、更差输出质量换来了表面跑分。
62万亿Token,比实验室跑分更有说服力
GLM-5.3-Flash此前以匿名模型Ox-Alpha的身份在OpenCode和OpenRouter上线,智谱最新披露的口径是6天Token调用量超过62万亿。OpenCode此前单独公布过6天约42万亿Token的数据,两者统计范围不同:42万亿对应OpenCode平台,62万亿则是智谱对多个入口给出的合计口径。
真实Token流量是此次披露中比峰值跑分更重要的数据。实验室基准通常使用固定输入长度和稳定并发,但编程Agent会持续读取代码仓库、工具返回结果和终端日志,输入长度变化大、缓存命中率不稳定,并且容易产生持续多轮调用。
62万亿Token也不等于62万亿个新生成Token。行业统计常会同时包含输入、输出、缓存读取或其他计量项目,不同平台口径并不完全一致;在智谱公布更细的输入输出拆分前,这个数字适合用来证明系统承受了大规模真实流量,不适合直接推导收入或平均成本。
匿名上线本身是一种更接近真实世界的压力测试。用户不知道模型品牌时,选择和留存更少受到厂商声量影响;与此同时,模型必须承受不可预测的仓库规模、提示词长度、并发峰值和Agent循环次数,这对推理系统的稳定性要求高于静态榜单。
成本做到NVIDIA相当,比“国产替代”更关键
国产芯片能否运行大模型已经不是最有价值的问题,能否以可持续成本稳定运行才是商业分界线。只要单位Token成本显著高于主流GPU,即使模型能够上线,流量越大也可能亏得越多。
GLM-5.3-Flash本身就是围绕推理经济性设计的模型。公开信息显示,它相对完整版GLM-5.3把注意力计算量降低约3.01倍、KV缓存占用降低约4.44倍,并通过180亿激活参数的MoE结构控制每次推理的实际计算量。
| 项目 | GLM-5.3-Flash | GLM-5.3 | 差异 | |---|---:|---:|---| | 总参数量 | 3200亿 | 未在本次披露中更新 | Flash采用MoE架构 | | 单次激活参数 | 180亿 | 未在本次披露中更新 | 影响实际推理计算量 | | 上下文窗口 | 约100万Token | 以官方当前版本为准 | Flash面向长上下文任务 | | 输入价格参考 | 0.15美元/百万Token | 1.40美元/百万Token | Flash约为其10.7% | | 输出价格参考 | 0.50美元/百万Token | 4.40美元/百万Token | Flash约为其11.4% | | 注意力计算量 | 1 | 3.01 | 官方模型结构口径 | | KV缓存占用 | 1 | 4.44 | 官方模型结构口径 |
价格只是开发者账单的表层,底层决定因素仍是每张芯片每秒能稳定处理多少有效Token。Infra Agent把同一硬件上的端到端吞吐做到3倍,理论上能够摊薄设备折旧、机房、电力和运维成本,但实际降本幅度不会机械地等于66.7%,因为网络、存储、冗余和空闲容量等成本不会同步缩减。
智谱关于“单Token成本与主流NVIDIA GPU相当”的结论仍需要更多数据支撑。公司尚未披露对比的是哪一代NVIDIA GPU、采用何种精度、上下文长度是多少,也没有公布首Token延迟、每Token延迟和服务可用性目标;在这些条件缺失时,“相当”应被视为厂商生产环境结论,而不是可复现的第三方基准。
这次实践改变了什么
这次实践首先改变了AI编程产品的边界。模型不仅可以编写业务代码,还能参与算子、编译、并行策略、缓存和集群调度等高门槛工作,基础设施团队由此可能从“亲手完成每次实验”转向“设计目标、提供工具、审查结果和处理异常”。
这次实践其次验证了国产算力需要模型与系统协同设计。国产芯片不必逐项复制CUDA和NVIDIA GPU的路径,只要模型结构、量化格式、通信拓扑与推理框架共同调整,就可能在特定工作负载上达到可接受的经济性。
这次实践最后给RSI提供了一个更现实的落点。短期内真正产生价值的递归自我改进,未必是模型秘密修改权重并突然获得更高智能,而是模型持续优化评测工具、推理系统、数据流程和Agent运行环境,让下一轮调用变得更快、更便宜、更可靠。
仍有四个问题需要智谱回答
这项成果距离完全透明、可复现的基础设施基准仍有明显距离。
- 吞吐口径尚未公开。 端到端提升3倍究竟按照请求数、输出Token还是输入输出加权Token统计,目前没有明确说明。
- 服务质量约束尚未公开。 如果吞吐提升伴随首Token延迟、尾延迟或失败率上升,其生产价值会打折扣。
- 芯片型号和集群拓扑尚未公开。 超过10万张国产芯片是重要规模指标,但不同芯片代际、节点配置和互联方式会显著影响结果。
- Agent与工程师的贡献边界尚未公开。 目前无法判断Infra Agent独立完成了多少代码、提出了多少有效优化,以及人工筛选和修正占多大比例。
这些缺口不妨碍该项目成为一个值得关注的生产案例,但会限制外界判断其通用性。对开发者而言,最有价值的后续材料不是更宏大的“自我进化”叙事,而是算子修改记录、性能剖析数据、失败案例、回滚机制和可复现的基准配置。
判断:这是系统工程突破,不是科幻式自我进化
GLM-5.3驱动Infra Agent的意义,在于大模型第一次被国内厂商公开放进超大规模国产推理系统的性能闭环,并用真实流量验证结果。不到两周实现3倍吞吐,说明Agent在复杂基础设施工作中已经具备明显的工程杠杆价值。
这项成果还不能证明模型能够不受监督地递归提升自身智能。GLM-5.3并没有自行重新训练GLM-5.3-Flash,也没有独立决定生产系统目标;它做的是在工程师建立的工具、权限和评测边界内,高频执行过去依赖人工完成的诊断与优化。
更值得重视的变化是,大模型竞争正在从参数、榜单和上下文窗口延伸到推理系统。模型效果相近时,谁能把每Token成本压低、把国产芯片利用率做高、把部署周期从数月缩短到数周,谁才有能力承接Agent时代持续增长的调用量。
对智谱而言,GLM-5.3-Flash只是台前产品,Infra Agent和十万卡推理栈才是这次披露中更有长期价值的部分。模型最终可能被新版本替代,但一套能够让模型持续参与优化自身运行环境的工程方法,会反复作用于后续每一代模型。
参考来源
- IT之家:智谱公开国内大模型首个递归自我改进实践——汇总智谱9月17日披露的Infra Agent、十万卡国产集群、3倍吞吐及62万亿Token等信息。
- SGLang GitHub仓库——智谱定制推理引擎所采用的开源高性能大模型服务框架。



