智谱GLM-5.3-Flash上线

智谱正式开放GLM-5.3-Flash:激活参数降至18B,注意力计算量缩减3.01倍,并以原生多模态、长上下文和国产算力适配切入开发者市场。
GLM-5.3-Flash正式从匿名测试走向开发者可用
智谱在8月26日正式上线并开源GLM-5.3-Flash,这款此前以“牛来”、Ox Alpha等匿名身份参与测试的模型,现在已经进入开发者可以实际调用、评估和部署的阶段。
GLM-5.3-Flash是智谱GLM-5系列首个原生多模态Flash模型,重点不是继续堆高参数,而是用更少的激活参数、更短的网络深度和混合注意力架构,降低编程智能体、长上下文与视觉任务的推理成本。
截至今天(2026年8月28日),此次发布已经过去两天。公开信息显示,GLM-5.3-Flash提供在线模型服务并开放模型权重,商汤大装置参与提供国产异构算力支持。对开发者来说,这意味着它不再只是排行榜里的匿名模型,而是一个可以纳入选型、压测和私有化部署计划的正式产品。

这次上新的真正看点,是智谱试图把前沿模型从“能力可用”推进到“成本可用”。智谱披露,GLM-5.3-Flash常规定价约为GLM-5.3的1/10,发布期折扣价格约为GLM-5.3的1/20、Claude Opus 4.8的1/40;但官方公开材料没有在同一口径下完整列出各模型每百万Token的绝对价格,因此这些比例更适合作为产品定位参考,不能直接替代企业自己的账单测算。
320B-A18B,Flash不是小模型
MoE是混合专家架构,它让模型保留较大的总参数容量,但每次生成Token时只激活其中一部分专家参数。
GLM-5.3-Flash对外发布时通常标记为320B-A18B,即总参数约3200亿、单次推理激活约180亿参数。它并不是一个18B小模型,而是一个拥有数千亿参数知识容量、每次只调用部分参数的稀疏模型。
这一点直接决定了它的使用边界。18B激活参数可以降低单Token计算量,却不会把数千亿参数的权重文件变没;如果按320B参数、BF16每参数2字节粗略估算,仅原始权重就需要约640GB存储,尚未计算KV缓存、运行时工作区、多模态编码器和并行通信开销。
因此,GLM-5.3-Flash的“低成本”主要是相对于同级前沿模型的在线推理成本,而不是意味着一张消费级显卡就能轻松部署。开发者可以通过量化和多卡并行压缩资源需求,但真正要获得高吞吐、长上下文和多模态能力,仍然需要服务器级硬件或集群。
这里还有一个需要智谱进一步澄清的参数口径问题。发布报道和模型名称普遍使用320B-A18B,而智谱开放文档的详细介绍一度写明GLM-5.3-Flash总参数为355B,并以GLM-4.5的320B作为对照;两种数字可能来自不同版本、是否计入多模态组件或统计方式差异,但在官方给出统一说明前,开发者不应把320B与355B混为一谈。
| 项目 | GLM-5.3-Flash | GLM-4.5 | GLM-5.3 | |---|---:|---:|---:| | 总参数 | 发布口径为320B;文档另有355B表述 | 约320B | 官方对比材料未统一披露 | | 激活参数 | 18B | 32B | 未统一披露 | | 网络层数 | 45层 | 92层 | 未统一披露 | | 多模态定位 | 原生图文、视频与视觉编程 | 非本次对比重点 | 高能力旗舰模型 | | 注意力计算量 | 约为GLM-5.3的1/3.01 | — | 作为1倍基线 | | KV缓存大小 | 约为GLM-5.3的1/4.44 | — | 作为1倍基线 | | 常规定价 | 约为GLM-5.3的1/10 | — | 作为1倍基线 | | 权重开放 | 是 | 是 | 以官方版本说明为准 |
网络层数从92层降到45层,是GLM-5.3-Flash降低生成延迟的另一条路径。大模型推理并不只看激活参数量,每生成一个Token都要按顺序穿过网络各层,层数几乎减半意味着串行计算路径明显缩短,尤其有利于代码补全、智能体操作和交互式视觉编辑这类对首字延迟与逐Token速度敏感的任务。
混合注意力瞄准的是百万级上下文账单
线性注意力是一类让计算量随上下文长度近似线性增长的注意力机制,它通过递归状态等方式压缩历史信息,避免每个Token都与全部历史Token进行完整两两比较。
稀疏注意力是一类只选择少量关键历史位置参与计算的注意力机制,它牺牲全量扫描,换取长上下文下更低的计算量和显存占用。
GLM-5.3-Flash把线性注意力与稀疏注意力放进同一套架构:前者负责持续吸收局部和顺序信息,后者利用轻量级索引器召回远距离的全局内容。可以把它理解成阅读一本超长档案时,一条通道负责不断更新“当前读到哪里”,另一条通道负责根据问题翻回少数关键页,而不是每写一个字都重新通读整本书。
IndexPool是智谱为长上下文索引器设计的缓存压缩机制,它通过加权池化,把索引器原有的4个缓存向量压缩成1个向量。智谱称,这项优化主要用于降低100万Token上下文下的索引延迟和内存开销。
按照官方对比数据,GLM-5.3-Flash每个Head、每层的注意力计算量比GLM-5.3降低3.01倍,平均KV缓存大小降低4.44倍。在智谱列出的GLM-5.3、DeepSeek-V4-Flash和Kimi-K3等基线中,GLM-5.3-Flash的注意力计算量最低,但KV缓存仍略高于Kimi-K3和DeepSeek-V4-Flash。
| 长上下文指标 | GLM-5.3-Flash相对表现 | 应如何理解 | |---|---:|---| | 注意力计算量 | 较GLM-5.3降低3.01倍 | 长提示词的预填充与持续生成成本更低 | | KV缓存大小 | 较GLM-5.3降低4.44倍 | 同一设备有机会承载更多并发会话 | | 索引缓存向量 | 4个压缩为1个 | 降低百万Token场景的索引器负担 | | 基线模型中的注意力成本 | 官方称为最低 | 仅代表指定架构指标,不等于所有任务总延迟最低 | | 基线模型中的KV缓存 | 高于Kimi-K3、DeepSeek-V4-Flash | 显存效率仍有继续优化空间 |
这些数字比单纯宣称支持“1M上下文”更有意义,因为上下文窗口能塞进去,不代表企业愿意为它付费。真正决定长文档应用能否上线的,是预填充延迟、KV缓存占用、并发会话数和长输出阶段的单Token成本。
不过,架构效率不能直接等同于信息召回准确率。线性注意力与稀疏注意力都在减少对历史Token的完整访问,模型能否在数十万乃至百万Token中稳定找回一条细节,仍需通过大海捞针、多跳推理、跨文档引用和真实代码仓库测试验证,开发者不应只看上下文窗口上限。
原生多模态不只是给聊天窗口加一双眼睛
原生多模态模型是在预训练和推理架构中统一处理文本、图像或视频信息的模型,而不是在语言模型外部临时挂接一个独立视觉识别模块。
GLM-5.3-Flash的重点场景包括视觉编程、网页生成、设计稿还原、视频理解和剪辑。智谱为Visual Coding设计了专用数据合成流程,让模型在执行任务时查看网页最终渲染结果、交互状态或3D场景,再根据视觉反馈修改代码。
这种“边写、边看、边改”的闭环,比一次性根据截图生成HTML更接近真实前端开发。传统代码模型只能判断语法是否正确,而接入视觉反馈后,模型还可以发现按钮位置偏移、颜色不一致、3D对象遮挡或响应式布局崩坏,再发起下一轮修改。
GLM-5.3-Flash对智能体任务的价值也高于普通聊天。编程智能体往往需要读取仓库、生成补丁、运行测试、查看页面并继续修复,模型不仅要会写代码,还要在较长执行轨迹里保持目标一致,并理解工具返回的文本、截图和视频信息。
此前的匿名测试为这项能力提供了真实流量验证。公开报道显示,“牛来”模型曾在OpenRouter和OpenCode获得较高调用量,编程与智能体表现是开发者集中讨论的部分;匿名测试的意义在于减少品牌偏见,但调用量排名仍然不等于严格能力排名,因为价格、上线位置、默认路由和尝鲜流量都会影响结果。
57分追平Opus 4.8,但不能简单写成全面平替
Artificial Analysis Intelligence Index是一个汇总多项推理、知识和编程测试的综合能力指数,用于在统一框架下比较不同模型。
GLM-5.3-Flash在该指数中获得57分,与Claude Opus 4.8持平,进入当前全球前沿模型区间。智谱自研的Z.ai Code Bench体感评估也显示,其编程表现与Claude Opus 4.8相当。
| 模型 | AA综合智能指数 | 权重形态 | 主要定位 | 已公开价格对比 | |---|---:|---|---|---| | GLM-5.3-Flash | 57分 | 开放权重 | 编程、智能体、长上下文、原生多模态 | 发布期约为Opus 4.8的1/40 | | Claude Opus 4.8 | 57分 | 闭源 | 高难推理、编程与智能体 | 作为价格比较基线 | | GLM-5.3 | 本次材料未列明 | 以官方说明为准 | GLM旗舰能力 | 常规价格约为Flash的10倍 | | DeepSeek-V4-Flash | 本次材料未列明 | 以官方说明为准 | 高效率推理 | KV缓存小于GLM-5.3-Flash | | Kimi-K3 | 本次材料未列明 | 以官方说明为准 | 长上下文与智能体 | KV缓存小于GLM-5.3-Flash |
57分说明GLM-5.3-Flash已经具备参与前沿模型竞争的资格,却不能推出它在所有任务上等同于Opus 4.8。综合指数会平均不同测试的得失,而企业真正关心的可能是大型代码库修改成功率、工具调用稳定性、中文金融材料引用准确率、视频理解时间跨度或幻觉率。
Z.ai Code Bench也需要按自研基准看待。厂商自建体感评估通常更贴近其目标产品场景,但测试集设计、提示词、采样参数、工具权限和判分方式都会影响结论;“相当”可以作为进入候选名单的理由,不能替代开发团队使用内部任务做盲测。
国产算力适配是这次发布的另一条主线
Encode-Prefill-Decode分离是一种把多模态编码、提示词预填充和逐Token解码拆成独立资源池的服务架构,每个阶段可以使用更适合自身计算特征的芯片和调度策略。
GLM-5.3-Flash在国产加速芯片上采用了这一分离式架构,并叠加Layer Split和混合缓存量化等优化。公开资料称,相关方案使端到端服务性能提升3倍,单Token成本达到与主流英伟达GPU相当的水平,商汤大装置为其提供了国产异构算力支持。
这套方案的现实意义不是证明某一颗国产芯片已经全面替代GPU,而是说明大模型服务的竞争正在从单芯片峰值算力,转向模型架构、推理引擎、并行策略和集群调度的共同优化。多模态编码偏计算密集,长提示词预填充需要高吞吐,逐Token解码则更受内存带宽和通信影响,把三个阶段强行放在同一类设备上,通常会造成资源浪费。
“性能提升3倍”仍然需要明确基线才能判断含金量。开发者在做国产硬件部署时,至少要继续核对测试所用的芯片型号、精度格式、输入输出长度、并发量、首Token延迟、每秒输出Token数及服务可用率,否则端到端倍率很难复现。
哪些团队值得现在就测试
GLM-5.3-Flash最适合成本敏感、上下文较长并且需要多模态工具调用的团队。它并不是单纯追求聊天质量的模型,而是把效率优势集中在持续运行的生产任务上。
- 代码智能体团队值得优先测试。 重点观察跨文件修改、测试修复、网页视觉还原、长轨迹工具调用和失败恢复能力。
- 长文档RAG团队值得做压力测试。 重点测量10万、50万和100万Token下的召回准确率、首Token延迟、并发量及KV缓存占用。
- 金融研究团队可以验证端到端交付。 模型被定位为可整合公告、财报与估值材料,并区分披露事实、分析假设和推导结果,但来源引用和公式勾稽仍需人工复核。
- 视频与内容生产团队可以验证闭环编辑。 关键不是模型能否描述视频,而是能否定位片段、理解时间线、生成修改方案并检查成片结果。
- 国产算力部署团队可以评估工程适配。 需要重点核对推理框架成熟度、算子覆盖率、量化损失、集群通信效率和故障恢复能力。
小团队则不必因为“A18B”就立刻考虑本地部署。数千亿总参数意味着权重存储和跨卡通信仍然沉重,对多数开发者而言,先使用托管服务完成任务成功率和成本验证,再决定是否私有化,通常比直接采购硬件更合理。
智谱真正想打的是“前沿能力的单位成本”
GLM-5.3-Flash的竞争策略很明确:它不需要在每一个榜单上绝对第一,只要把接近旗舰模型的能力压到显著更低的价格和国产算力成本,就有机会进入大量原本用不起前沿模型的生产流程。
这也是Flash模型与传统轻量模型的区别。轻量模型通常通过缩小参数规模换取便宜和速度,Flash路线则试图保留大模型的知识容量与复杂任务上限,再从激活参数、网络层数、注意力机制、KV缓存和服务调度上削减成本。
从目前披露的数据看,GLM-5.3-Flash已经给出了几项有分量的工程结果:激活参数从32B降至18B,层数从92层降至45层,注意力计算量相对GLM-5.3减少3.01倍,KV缓存减少4.44倍,国产芯片端到端服务性能提升3倍,AA综合指数达到57分。
但这款模型距离“无条件平替旗舰闭源模型”仍有距离。参数口径尚未完全统一,百万Token下的真实召回表现需要独立测试,国产硬件的3倍性能提升缺少完整基线,发布期1/40价格也不代表长期总拥有成本。
更准确的判断是,GLM-5.3-Flash已经成为2026年下半年值得开发者认真压测的一款国产前沿模型。它最有价值的地方不是某一个跑分,而是把原生多模态、代码智能体、百万级上下文、开放权重和国产算力适配放进同一款产品,并且开始用明确的计算量、缓存和价格比例证明其效率。
参考来源
- GLM-5.3-Flash模型权重与模型卡(Hugging Face):用于核对开放权重、模型配置、部署说明与后续版本更新;具体参数应以模型仓库最新配置文件为准。



