GLM-5.3靠后训练再涨50%

智谱发布GLM-5.3,在基座不变的情况下扩大强化学习与长程任务训练,内部编程评测较GLM-5.2提升50%,模型权重计划两周后开放。
同一套基座,智谱又把代码能力往上推了一截
智谱今天(2026年8月14日)正式发布 GLM-5.3,核心变化不是换了更大的基座模型,而是把后训练规模继续做大。按照智谱公布的数据,GLM-5.3 在内部真实编程评测中较 GLM-5.2 提升 50%,并在 Terminal-Bench 3.0、Agents' Last Exam(CLI)等公开测试中取得开源模型第一。
后训练 Scaling 是指在预训练完成后,通过监督微调、强化学习、任务环境扩展和更长训练周期继续提升模型能力。它与单纯增加参数、数据和预训练算力不同,更像是给已经掌握基础知识的模型安排强度更高、反馈更明确的长期实战训练。
这次发布最值得关注的地方也正在于此:GLM-5.3 与 GLM-5.2 使用完全相同的基座,但公开基准和内部体感都出现了明显变化。智谱称,其后训练使用了数十倍规模的长程任务环境、更丰富的环境类型以及更长的训练时间,并建立在 IndexShare、SAO 和持续演进的新一代 Slime 框架之上。

50%提升很亮眼,但要先看清统计口径
“编程能力提升50%”来自智谱自建的 Z.ai Code Bench,而不是所有公开代码基准的平均涨幅。Z.ai Code Bench 是一套面向真实 Coding Agent 使用体验的内部评估体系,模型会进入复杂的本地开发环境,在不同思考档位下完成端到端任务,同时考察正确率和 Token 利用效率。
内部评测的优势是能够覆盖尚未被公开基准充分衡量的真实开发流程,但局限也同样明显:外部开发者目前无法完整复现其环境、任务分布和裁判规则。因此,“提升50%”更适合被理解为智谱产品团队对实际编程体感的量化,而不是一个可以直接横向套用到所有模型上的通用结论。
公开数据则给出了更可比较的变化。GLM-5.3 在 Terminal-Bench 3.0 上从 4.6 分提升到 28.3 分,增加 23.7 分,增幅约为 515%;在 DeepSWE v1.1 上从 46.2 分提升到 66.9 分,增加 20.7 分,增幅约为 44.8%;在 Agents' Last Exam 上从 23.8 分提升到 28.5 分,增加 4.7 分,增幅约为 19.7%。
| 评测项目 | GLM-5.2 | GLM-5.3 | 绝对提升 | 相对增幅 | 主要考察能力 | |---|---:|---:|---:|---:|---| | Terminal-Bench 3.0 | 4.6 | 28.3 | 23.7 | 约 515% | 在真实终端中执行复杂、多步骤任务 | | DeepSWE v1.1 | 46.2 | 66.9 | 20.7 | 约 44.8% | 长程软件工程、持续修改与验证代码 | | Agents' Last Exam | 23.8 | 28.5 | 4.7 | 约 19.7% | 跨工具协作、专业任务与长程执行 | | GDPval-AA v2 | 未公布 | 1,769 | — | — | 覆盖44种职业的高价值知识工作 | | Z.ai Code Bench High | 未公布 | 31.4%准确率 | — | — | 真实本地开发环境中的综合编程体感 |
Terminal-Bench 3.0 的增长尤其值得重视,因为它衡量的不是模型能否补全一段函数,而是能否在终端环境里理解任务、操作文件、调用工具、运行测试并处理失败。4.6 到 28.3 不只是“代码写得更像”,而是模型从大量任务几乎无法完成,进步到能够稳定解决其中一部分复杂流程。
DeepSWE v1.1 的提升则更接近日常软件工程的核心需求。它关注模型能否在现有代码库中持续修改代码,并在多轮操作后维持需求、实现和测试之间的一致性;66.9 分意味着 GLM-5.3 的优势并非只集中在短题推理,而是延伸到了跨文件理解和长程迭代。
Agents' Last Exam 的增幅相对温和,说明通用智能体能力仍比代码专项能力更难通过后训练快速拉升。模型在终端和软件工程任务上的进步可以依赖明确的编译结果、测试用例和运行反馈,而专业知识工作往往没有唯一答案,自我评估和奖励设计也更困难。
后训练Scaling正在成为新的主战场
GLM-5.3 的真正信号是,模型厂商开始把后训练当成与预训练同等重要的规模化工程。过去的 Scaling Law 主要围绕参数量、训练数据和计算量展开,而今天的 Coding Agent 需要在动态环境里经历大量“规划—执行—报错—修复—验证”循环,静态文本预测已经不足以覆盖这些能力。
强化学习是让模型根据环境反馈和奖励信号调整行为策略的训练方法。对于编程模型而言,编译是否通过、测试是否成功、性能是否提高都可以转化为相对清晰的反馈,这使代码成为当前最适合扩大强化学习规模的领域之一。
长程任务环境是允许模型连续执行多轮工具调用、文件修改和结果验证的训练沙箱。它与一次问答最大的区别在于,模型前面做出的架构选择会持续影响后面的执行,一次错误的依赖安装、路径判断或接口修改,都可能在几十步后演变成任务失败。
智谱此次强调“数十倍的长程任务环境”,意味着训练重点已经从增加题目数量转向增加交互轨迹的数量、长度和多样性。模型不只需要看到正确代码,还要学习在真实工程中如何发现自己错了、如何回退,以及什么时候应该换一种策略。
IndexShare、SAO 与 Slime 共同构成了智谱扩大后训练的基础设施和方法栈。智谱目前没有在此次公开信息中披露足够完整的消融实验,因此外界尚不能准确判断三者分别贡献了多少性能;可以确认的是,GLM-5.3 的主要增量来自这套强化学习工程,而不是新的基础模型。
这种路线对行业有两层影响。第一层是延长同一基座的生命周期,厂商不必每隔几个月重新训练一个参数更多的模型;第二层是改变竞争壁垒,决定模型上限的不再只是 GPU 数量和预训练语料,还包括能否搭建足够复杂的环境、生成高质量任务,并让奖励系统不被模型钻空子。
从“会写代码”转向“能完成工程”
GLM-5.3 的能力增长集中在 Coding Agent,而不是传统代码补全。代码补全模型主要预测下一段代码,Coding Agent 则需要读取仓库、制定计划、编辑多个文件、执行命令、检查结果并持续修正,二者的差距类似于“会写一个零件”和“能把整台机器装起来”。
这也是为什么 Token 利用率变得重要。一个模型即使最终完成任务,如果需要反复读取整个仓库、进行大量无效推理或多次推翻方案,其实际成本和延迟仍可能无法接受;智谱称 GLM-5.3 在效果与 Token 利用率之间取得了更好的平衡,并在 Z.ai Code Bench 的 High 档位达到 31.4% 准确率。
Token 利用率是模型用有限上下文和推理预算完成任务的效率。对开发者来说,它会直接反映为等待时间、推理费用以及智能体能否在上下文耗尽前完成交付,因此真实编程体验不能只看最终正确率。
GLM-5.3 对国产模型市场的直接冲击也会发生在编程场景。智谱称其编程体感已经超过其他国产模型,综合能力接近 Claude Fable 5;不过,这一比较目前主要来自官方测试和内部体验,在模型权重开放、第三方复测完成之前,还不能视为行业共识。
| 对比维度 | GLM-5.2 | GLM-5.3 | 实际意义 | |---|---|---|---| | 基座模型 | 与5.3相同 | 与5.2相同 | 性能提升不能归因于参数扩张 | | 后训练规模 | 原有规模 | 长程环境扩大数十倍 | 增加复杂任务与失败恢复经验 | | 公开终端评测 | Terminal-Bench 3.0为4.6 | Terminal-Bench 3.0为28.3 | 终端操作与任务执行明显增强 | | 长程工程能力 | DeepSWE v1.1为46.2 | DeepSWE v1.1为66.9 | 更适合跨文件持续修改 | | 网络安全能力 | 未披露同口径数据 | 官方称持平Mythos 5 | 开始进入代码审计和漏洞发现 | | 权重状态 | 已有前代发布路径 | 计划发布两周后开放 | 当前仍不能完整本地复现 |
网络安全能力涌现,价值和风险同时上升
GLM-5.3 还出现了智谱所称的“涌现式网络安全能力”,即模型在没有更换基座的情况下,通过编程和智能体训练获得更强的代码审计与漏洞发现表现。根据官方说法,GLM-5.3 在白盒代码审查和漏洞发现等安全任务中持平 Mythos 5。
白盒代码审查是指模型可以直接读取源代码、依赖关系和程序结构,并据此寻找潜在漏洞。它比只观察输入输出的黑盒测试拥有更多信息,也更适合自动检查内存安全、权限控制、注入风险和业务逻辑缺陷。
安全能力增强对企业开发团队有现实价值。大型仓库往往积累了大量人工难以覆盖的旧代码和第三方依赖,能够自主浏览仓库、定位风险并给出修复方案的模型,有机会把安全审计从版本发布前的集中检查,变成贯穿开发过程的持续任务。
安全能力增强同时也提高了模型的双重用途风险。能够寻找漏洞的模型既可以帮助防守方修复问题,也可能被用于扩大漏洞扫描和利用尝试,因此智谱没有在发布当天立即开放权重,而是留出两周进行安全评估与模型加固。
这两周的延迟不是无关紧要的发布安排。按照当前计划,GLM-5.3 权重预计在8月下旬开放;在权重真正可下载、许可证公布且第三方可以本地运行之前,更准确的说法应是“智谱宣布将开源 GLM-5.3”,而不是模型已经完成全面开源交付。
“开源第一”还需要第三方复测
智谱给 GLM-5.3 的定位是当前编程能力最强的开源模型,但这个结论仍需要等待权重开放后的独立验证。开源模型是指开发者可以获得模型权重,并按照许可证在本地或自有基础设施中部署、评估和修改的模型;仅有在线服务或跑分公告,并不足以完成可复现意义上的开源。
第三方复测需要重点检查四件事:公开成绩是否使用一致的智能体框架,工具调用次数和推理预算是否相同,失败重试策略是否一致,以及模型是否针对测试集做过特殊优化。Coding Agent 的最终成绩不仅由模型决定,系统提示词、上下文整理、工具实现和测试时算力都可能带来显著差异。
开发者也不应只根据单项榜单决定是否迁移。GLM-5.3 如果要进入真实生产环境,还需要观察首 Token 延迟、长任务总耗时、显存需求、量化后的性能保持率、许可证限制以及常用智能体框架的适配情况,而这些信息在今天的发布材料中仍不完整。
价格同样是此次发布缺失的重要变量。智谱尚未在给出的发布信息中提供 GLM-5.3 的完整推理价格和本地部署成本,因此目前无法判断它的 Token 效率提升能否转化为更低的单任务成本,也无法与主流闭源编程模型做严格的价格—性能比较。
这次升级的意义,不只是榜单多了一个第一
GLM-5.3 证明了同一个基座仍可能通过后训练获得接近换代级别的性能增长。Terminal-Bench 3.0 从4.6升到28.3、DeepSWE v1.1从46.2升到66.9,说明基础模型完成预训练时,其潜在的工具使用和长程执行能力可能远未被充分释放。
这条路线也比单纯堆参数更适合开源模型竞争。预训练超大模型需要集中投入巨额算力,而后训练可以围绕代码、终端、浏览器、安全审计等场景不断增加环境和反馈,让模型在特定高价值任务上更快缩小与闭源产品的差距。
GLM-5.3 当前最强的产品价值不是替开发者生成更多代码,而是减少开发者在多轮任务中反复纠错和重新解释上下文的次数。如果它在权重开放后仍能复现官方成绩,那么本地 Coding Agent、企业私有代码审查和自动化软件维护都会多出一个有竞争力的开源选择。
GLM-5.3 当前最大的保留项同样清楚:50%来自内部体感评测,网络安全对比缺少完整细节,权重尚未开放,部署成本也没有公布。因此,这是一场技术信号很强、最终结论仍需等待两周的发布,而不是已经完成全部验证的胜利宣言。
参考来源
- IT之家:智谱正式发布 GLM-5.3,较 GLM-5.2 提升50%——汇总智谱发布信息、公开基准成绩、后训练路线及权重开放计划。



