GLM-5.3完整权重正式开放下载

智谱按计划开放GLM-5.3完整模型权重,开发者现在可以从Hugging Face下载并研究这一款面向长程编程与智能体任务的开放权重模型。它在漏洞发现、终端操作和软件工程基准上明显超过GLM-5.2,但更强的网络安全能力也带来了新的开源风险。
GLM-5.3完整权重正式开放下载
智谱已经开放GLM-5.3完整模型权重,开发者可从Hugging Face下载、部署和研究这一款面向编程与智能体任务的开放权重模型。距离智谱8月14日发布GLM-5.3,正好过去约两周;这段延迟并不是发布节奏上的偶然变化,而是智谱专门为模型安全评估和能力加固留下的缓冲期。
GLM-5.3最值得关注的地方,不是参数规模突然变大,而是它把后训练的重点从“回答一道编程题”推进到了“独立完成一段复杂的软件工程工作”。与此同时,模型在漏洞发现和漏洞利用任务上的能力也出现了超出预期的增长。对开发者来说,这意味着一个更强的本地编程模型终于可以被下载;对安全行业来说,这也意味着一套能够大规模复制的代码分析能力进入了更开放的分发阶段。

这次开放的到底是什么
开放权重模型是指模型训练完成后的参数可以被开发者下载和本地运行,但不等于训练数据、完整训练流程和所有配套基础设施全部公开。 GLM-5.3此次进入的是“完整模型可下载”阶段,开发者可以获得模型权重,并在自己的计算环境中进行推理、评估和二次开发。
从目前公开信息看,GLM-5.3沿用了GLM-5.2的基础模型,主要变化来自后训练阶段。智谱没有公布GLM-5.3的具体参数规模,因此不应简单把它理解为一次更大模型替换。更准确的说法是:智谱在同一基座上投入了更长的训练时间、更复杂的任务环境和更大规模的强化学习,让模型更擅长规划、调用工具、检查结果,并在失败后继续修正。
GLM-5.3目前有几个直接影响部署和使用的规格:
- 模态:目前仅支持文本输入与输出;
- 上下文窗口:支持1M tokens,适合处理大型代码库、长日志和多轮工程记录;
- 最大输出:最高128K tokens;
- 思考模式:始终启用思考,不再支持关闭思考;
- 思考强度:提供
low、high和max三个级别; - 主要场景:软件开发、终端操作、代码修复、漏洞发现、长程智能体任务。
1M上下文并不意味着模型可以无成本地把整个公司代码库一次性塞进去。上下文长度解决的是“能不能看得下”的问题,不能自动解决检索噪声、状态管理和推理成本问题。真正使用时,开发者仍然需要配合代码索引、文件筛选、任务分解和上下文压缩,否则长上下文很容易变成一堆模型无法有效利用的文本。
GLM-5.3相比GLM-5.2提升了多少
GLM-5.3的核心升级是长程任务能力,而不是传统问答能力。 它被训练去完成更接近真实工作的任务:读取项目、安装依赖、执行命令、修改代码、运行测试、定位失败原因,再根据结果继续迭代。
智谱公布的几项测试数据显示,GLM-5.3在工程类任务上的提升非常明显:
| 评测项目 | GLM-5.2 | GLM-5.3 | 变化 | |---|---:|---:|---:| | Terminal-Bench 3.0 | 4.6 | 28.3 | 提升约515% | | DeepSWE v1.1 | 46.2 | 66.9 | 提升20.7个百分点 | | Agents' Last Exam | 23.8 | 28.5 | 提升4.7个百分点 | | Z.ai Code Bench | — | 相比前代提升约50% | 智谱内部评测 |
Terminal-Bench 3.0的变化尤其能说明问题。它考察的不是模型能否生成一段看起来正确的代码,而是模型能否在终端环境中处理安装软件、修改配置、排查故障和完成系统级任务。GLM-5.2的得分为4.6,GLM-5.3升到28.3,虽然绝对分数仍不能说明它已经可以无监督接管生产环境,但模型从“偶尔完成”走向“具备一定稳定性”的意味很明显。
在智谱自建的Z.ai Code Bench中,GLM-5.3在High档位的准确率达到31.4%。智谱给出的对照是,Claude Opus 4.8最高档位准确率为29.5%。更有意思的是,GLM-5.3每项任务平均输出约5万tokens,而Claude Opus 4.8约需12万tokens。
这组数据不能直接推导出GLM-5.3全面超过Claude,也不能替代独立第三方测试。不同模型的提示词、工具配置、任务采样和评分标准可能存在差异。不过,它至少说明了一个方向:GLM-5.3并非单纯靠输出更长的思维过程来堆分,而是在单位输出量和任务成本上试图提高有效工作密度。
进步的来源:把训练环境做得更像真实工作
任务环境是供智能体执行、验证和获得反馈的可运行工作空间,GLM-5.3的能力增长很大程度上来自这类环境的规模化。
传统编程训练往往是一道题、一个输入、一个标准答案,模型只需生成代码并等待评分。真实工程则完全不同:依赖可能装不上,测试可能不完整,文档可能过时,性能瓶颈可能隐藏在多个组件之间,最终结果还需要通过实验验证。
智谱在GLM-5.3的技术说明中提到,它构建了端到端合成任务环境的流水线,让模型面对包含多步骤依赖关系和隐藏状态的长程任务。评审智能体会先尝试完成任务,以确认环境确实可解;验证器则在不读取参考解法的情况下生成奖励信号,并通过Oracle、空操作和未解决状态检查,减少模型利用评分漏洞“刷分”的可能。
这套方法的价值在于,模型训练目标从“写出答案”变成了“让系统最终工作”。例如,一个机器学习基础设施任务可能要求模型在类似工程师的环境中定位训练瓶颈,修改代码或配置,运行实验,并在保证结果正确的前提下实现可量化的端到端加速。这样的训练更接近程序员、运维工程师和研究工程师日常处理的问题。
GLM-5.3还延续了GLM-5.2中的SAO等强化学习策略,并结合上下文压缩机制,让模型在长任务中保留关键状态。对智能体而言,这一点比单轮回答更重要:它必须记住已经改了什么、哪些方案失败过、下一步要验证什么,而不是每一轮都从头开始。
网络安全能力成为最大亮点,也成为最大争议
漏洞发现能力是识别和验证代码缺陷的能力,漏洞利用能力则是进一步构造攻击路径、执行利用并获得目标效果的能力,两者之间存在明显差距。
GLM-5.3在安全任务上的表现呈现出很清晰的“两面性”。在CyberGym上,它的成功率达到84.5%,高于GLM-5.2的77.2%,也略高于智谱公布的Mythos 5的83.8%和GPT-5.6 Sol的83.6%。这一测试主要从白盒源代码出发,通过触发程序故障来识别和验证漏洞。
但在更强调深层利用能力的ExploitBench上,GLM-5.3得分为54.4%,虽然比GLM-5.2的24.4%高出30个百分点,但仍低于Mythos 5的78.0%和GPT-5.6 Sol的76.5%。在按预算归一化的ExploitGym吞吐量测试中,GLM-5.3两小时完成105项任务、六小时完成130项;GLM-5.2对应数据仅为29项和39项,而Mythos 5分别完成181项和247项。
| 安全能力评测 | GLM-5.2 | GLM-5.3 | Mythos 5 | GPT-5.6 Sol | |---|---:|---:|---:|---:| | CyberGym | 77.2% | 84.5% | 83.8% | 83.6% | | ExploitBench | 24.4% | 54.4% | 78.0% | 76.5% | | ExploitGym,2小时完成任务数 | 29 | 105 | 181 | — | | ExploitGym,6小时完成任务数 | 39 | 130 | 247 | — |
这些结果说明,GLM-5.3已经接近领先模型的漏洞识别水平,但在连续构造复杂利用链方面仍有差距。把它称作“会找漏洞”是准确的,把它描述成“可以稳定打穿真实系统”则明显夸大。
智谱还披露,GLM-5.3在269个真实项目中识别出2436个漏洞,其中包括1097个中高危问题。这个数字很能体现模型的规模化审计潜力,但也需要谨慎解读:发现漏洞不等于漏洞都能被现实攻击复现,自动化扫描结果也需要人工确认、去重和风险分级。
问题在于,开放权重会改变能力的扩散方式。在线服务可以增加访问控制、限制工具权限、监控异常行为;模型下载之后,开发者则可以在本地修改推理流程、重新训练模型,或者把它接入代码扫描、网络访问和命令执行工具。智谱能够对官方服务负责,却无法控制所有本地部署实例的用途。
这也是智谱把完整权重延后约两周开放的原因。它试图在开放开发者生态和安全风险之间争取时间,先做额外评估、模型加固和风险边界确认。这个决定值得肯定,但它并没有解决开放权重的根本矛盾:一旦权重公开,安全策略本身就可能被研究、绕过或移除。
对开发者意味着什么
GLM-5.3最适合优先部署在可控的代码工程环境,而不是直接授予它生产系统的全权操作权限。
如果你的团队需要处理大型代码库、长日志和跨文件重构,1M上下文窗口会带来实际便利;如果你在做自动化修复、测试生成、终端排障或安全审计,GLM-5.3相比GLM-5.2的长程任务能力提升更值得关注。
不过,下载权重不等于低门槛运行。完整模型的显存需求、量化质量、推理速度和并发能力,需要开发者根据模型仓库给出的文件规格和社区实测进一步确认。尤其是128K最大输出和1M上下文,更像能力上限,而不是所有硬件都能轻松承受的默认配置。
建议开发者按以下顺序评估:
- 先做离线代码基准测试:使用团队自己的仓库和历史缺陷样本,而不是只看公开榜单;
- 区分生成质量与任务完成率:代码看起来合理,不代表测试能通过或部署后稳定运行;
- 限制工具权限:默认使用沙箱、临时凭证和只读文件系统,避免模型直接接触生产网络;
- 保留人工审核节点:涉及数据库迁移、权限变更、依赖升级和安全修复时,不要让模型自动合并;
- 单独测试安全边界:评估它会不会执行危险命令、泄露上下文、扩大扫描范围或在失败后自行改变策略;
- 比较总成本:不仅看模型权重是否免费,还要计算显卡、存储、推理延迟、并发和运维成本。
从产品角度看,GLM-5.3的真正竞争力可能不在“又一个国产大模型”,而在于它把开放权重模型向更完整的工程智能体推进了一步。过去很多开放模型擅长补全代码和回答技术问题,但遇到需要操作终端、连续调试和跨步骤验证的任务就容易失效。GLM-5.3正在补上这段差距。
它会改变开放模型竞争吗
GLM-5.3的开放意义在于把前沿编程能力从在线产品进一步带入可本地控制的开发环境,但它距离“全面替代闭源旗舰”仍有距离。
智谱称,GLM-5.3在Artificial Analysis Intelligence Index上取得60分,进入前沿模型能力区间,并与多款旗舰模型处于同一水平。这个结果显示它在知识、推理、编码和智能体等综合维度上具备竞争力,但综合指数不能掩盖具体任务的差异:它在代码工程和漏洞发现上表现突出,在复杂漏洞利用、工具可靠性和长任务稳定性上仍需要更多独立验证。
更现实的判断是,GLM-5.3会成为开放权重编程模型中的重要候选,尤其适合对数据控制、本地部署和二次定制有要求的团队。它未必是每个场景下最强的模型,却可能是“能力、成本、可控性”三者之间更平衡的选择。
从GLM-5.3开始,开放模型的评判标准也会发生变化。开发者不应只比较参数量、单项榜单和上下文长度,还要看模型能否在真实环境中完成任务,能否处理失败,能否解释修改原因,以及开放之后如何面对网络安全风险。
截至2026年8月29日,GLM-5.3已经从“即将开放权重”变成“开发者可以下载和研究的完整模型”。智谱这次没有因为安全能力变强而永久收回开放承诺,但它用延后两周的方式承认了一个事实:当编程模型开始具备更强的漏洞发现能力,开放权重不再只是生态策略,也是一项需要持续承担后果的安全决策。
参考来源
- Hugging Face:GLM-5.3模型仓库 —— 智谱发布的GLM-5.3开放权重仓库,包含模型文件、使用说明及相关元数据。



