AI 快讯深信服AI杀进CyberGym前四
模型上新

深信服AI杀进CyberGym前四

2026-07-29T06:04:22.053Z
深信服AI杀进CyberGym前四

深信服Sangfor AI以GLM-5.2为基座,在CyberGym全量1507项漏洞挑战中完成1301项,成功率86.3%,进入全球前四并位列国内第一。

深信服用国产模型拿下CyberGym 86.3%成功率

深信服旗下Sangfor AI近日进入CyberGym全球前四,并成为该安全评测中排名最高的国内参评团队。按照深信服公布的数据,系统在固定使用国产基座模型GLM-5.2的条件下,完成了涵盖ARVO与OSS-Fuzz的1507项漏洞挑战,其中1301项通过验证,整体成功率为86.3%。

这个成绩真正值得注意的地方,不只是“国内第一”,而是Sangfor AI跑完了全量任务。1507个漏洞实例全部纳入统计,意味着结果不是在几十道精选题、某一种漏洞类型或某几个熟悉项目上得到的局部高分;即便如此,系统仍然只留下206项未解决任务。

CyberGym全球榜单与Sangfor AI完成1301项漏洞挑战的数据示意图

CyberGym是一个面向AI智能体真实网络安全能力的大规模评测基准,其核心任务不是让模型回答漏洞知识题,而是让智能体进入真实开源项目,在补丁前代码中生成能够触发指定漏洞的概念验证输入。它覆盖188个开源软件项目、1507个真实漏洞实例,项目包括OpenSSL、FFmpeg、OpenCV等生产环境广泛使用的软件,代码规模从数万行延伸到数百万行。

这让CyberGym与常见的代码选择题、CTF题库或静态漏洞分类测试有明显区别。模型知道“缓冲区溢出是什么”没有用,它必须读懂跨文件调用关系、定位输入入口、推导漏洞触发条件,再生成能让程序按预期崩溃的输入;整个过程更像让AI独立接手一张漏洞工单,而不是参加一场安全知识考试。

1301项任务是怎样被判定成功的

PoC是Proof of Concept的缩写,指用于证明漏洞真实存在并可被触发的概念验证样本。在CyberGym的漏洞复现任务中,智能体会获得漏洞的文本描述和补丁前代码库,随后需要生成PoC测试,让目标程序在修复前版本出现对应异常,同时在修复后版本不再触发。

CyberGym采用基于执行结果的验证方式,而不是让另一台大模型判断答案是否“看起来合理”。评测会实际编译并运行补丁前后的程序,并借助AddressSanitizer等检测机制确认内存越界、空指针访问、释放后使用等异常,因此一份只分析对了根因、却无法真正触发漏洞的报告,不会被计为成功。

OSS-Fuzz是Google推动的开源软件持续模糊测试服务,长期对大量关键开源项目执行自动化漏洞发现。ARVO则是围绕真实开源漏洞构建的可复现数据与运行环境,两者都强调漏洞、代码版本、编译条件和触发样本之间的可验证关系,而不是人为编写的玩具案例。

CyberGym覆盖28类程序崩溃问题,其代码库中位数达到1117个文件、387491行代码。智能体经常需要从数十万行代码中找到一条很窄的触发路径,例如先构造特定文件头,再让解析器进入异常状态,最后通过长度字段、对象生命周期或嵌套结构触发内存错误。

这也是86.3%显得激进的原因。CyberGym论文早期实验显示,主流模型与通用软件工程智能体在漏洞复现任务上的成功率通常只有个位数到约20%;专门针对普通代码修复任务训练的模型,部分配置甚至低于2%。安全问题需要处理二进制输入、内存布局、编译环境和复杂控制流,这些能力并不会自动从SWE-bench一类代码修复基准迁移过来。

不能把86.3%简单理解成GLM-5.2的裸模型跑分

Sangfor AI是由基座模型、工具调用、任务规划、执行环境与结果验证共同组成的安全智能体系统,86.3%首先是整套系统的成绩,而不是GLM-5.2单次问答的准确率。深信服强调评测期间采用固定模型配置,这能排除针对不同题目临时切换基座模型的情况,但并不意味着系统只向模型发送一次提示词就直接得到PoC。

Agent Swarm是让多个具有不同职责的智能体并行或分阶段处理同一任务的协作架构。根据目前披露的信息,Sangfor AI使用了类似多智能体协同的设计,可将代码检索、漏洞定位、路径推理、PoC生成、编译执行和失败修正拆分为多个环节,再通过实际运行结果形成反馈闭环。

这种架构更像一支安全研究小组,而不是一个万能聊天机器人。一个智能体负责缩小可疑代码范围,另一个追踪跨文件数据流,第三个构造输入,执行智能体负责调用编译器和测试环境;PoC如果没有触发预期异常,系统还可以根据日志修改假设,而不是把第一版答案直接提交。

固定使用GLM-5.2仍然具有现实意义。GLM-5.2是本次Sangfor AI评测使用的国产基座大模型,它承担长代码理解、推理和任务规划等核心工作;在没有依赖海外闭源基座模型的条件下进入全球前四,说明国产模型至少已经能够支撑高强度、长链路的安全Agent工作流。

不过,目前公开信息没有完整披露GLM-5.2在本次评测中的上下文长度、推理预算、并发智能体数量、单任务最大迭代次数和平均计算成本。缺少这些数据,就无法判断1301项成功任务用了多少次模型调用、多少GPU时间,以及与其他榜单配置相比是否处于相同资源约束下。

与论文早期结果相比,86.3%高出了一个时代

CyberGym公开论文与后续评测包含不同任务级别、智能体框架和推理预算,因此历史成绩只能用于观察难度,不能直接作为同协议横向排名。尤其是GPT-5的22.0%来自特定子集和高推理配置,OpenHands与Claude的成绩则来自论文阶段的主要漏洞复现任务,它们与深信服本次全量榜单口径未必完全一致。

| 系统或配置 | 基座模型 | 公布成功率 | 评测范围与说明 | |---|---|---:|---| | Sangfor AI | GLM-5.2 | 86.3% | 1507项全量挑战,成功1301项;深信服称为固定模型配置 | | OpenHands历史实验 | Claude Sonnet 4 | 17.9% | CyberGym论文相关主要复现任务结果,属于早期研究口径 | | 高推理配置历史实验 | GPT-5 | 22.0% | 特定基准子集,基础配置为7.7%,不能与全量结果直接换算 | | OpenHands历史实验 | Claude 3.7 Sonnet | 11.9% | 论文评述中的漏洞复现成绩,模型和实验版本不同 | | 部分SWE专用模型 | 多种软件工程模型 | 低于2% | 表明普通代码修复能力不等于漏洞复现能力 |

从数字上计算,86.3%约为17.9%的4.82倍,但把它表述成“能力提升4.82倍”并不严谨。智能体框架、工具权限、推理轮数、运行环境和榜单版本都会显著影响成绩;在CyberGym这类动态评测里,系统能否持续编译、执行、读取崩溃日志并修正PoC,往往和基座模型本身同样重要。

“全球前四”也需要等待更完整的榜单快照来判断含金量。深信服披露Sangfor AI与OpenAI、Anthropic、Meta等厂商的模型或智能体同场评测,但目前公开报道没有给出前三名系统名称、具体得分、资源限制和失败任务重叠情况,因此不能进一步推断它与第一名的差距。

现阶段最稳妥的结论是:Sangfor AI在深信服所公布的CyberGym全量评测口径下,以1301/1507的结果达到86.3%,进入全球前四;这是一项系统级安全Agent成绩,也是一项由GLM-5.2支撑的国产技术栈成绩,但还不能被简化成GLM-5.2与GPT、Claude之间的裸模型对决。

为什么传统SAST很难完成同样的任务

SAST是Static Application Security Testing的缩写,指在不运行程序的情况下,通过规则、语法树和数据流分析发现源代码风险的静态应用安全测试。它擅长识别危险函数调用、硬编码凭证和部分注入问题,但面对复杂业务逻辑、跨模块状态变化或需要特定输入序列才能触发的漏洞时,容易出现漏报和误报。

安全Agent的关键变化是从“匹配可疑模式”转向“提出假设并执行验证”。它不仅指出某个长度参数可能缺少边界检查,还要沿着程序入口找到可控输入、构造符合协议格式的样本、运行目标程序,并证明问题在补丁前存在、补丁后消失。

这种能力对企业研发流程更有价值,因为安全团队真正缺少的通常不是更多告警,而是经过验证、可以排定优先级的漏洞。一个扫描器每天生成上千条疑似问题,如果其中大部分无法复现,研发人员最终会对告警失去信任;一个能提供触发路径和验证证据的Agent,即使发现数量更少,也更可能推动漏洞被真正修复。

Sangfor AI若能把榜单能力稳定迁移到企业环境,最直接的落点会是代码提交和CI/CD流水线。系统可以在合并代码前自动分析变更、运行定向验证,并把高置信度问题连同路径、影响范围和复现证据交给开发者,从而将部分人工审计从“逐文件阅读”变成“审核AI给出的证据”。

业务逻辑漏洞会是更难、也更有商业价值的下一关。越权访问、认证绕过和订单状态机错误通常不会直接导致程序崩溃,也不一定存在一个危险函数,Agent需要理解角色、权限、数据对象和业务流程之间的关系;CyberGym证明了它能做复杂代码推理,但尚不能直接证明它已经解决了企业业务语义问题。

高分之外,还要追问成本、泛化和误报

安全Agent进入生产环境的第一道门槛是单位任务成本。1507项离线挑战可以允许系统多轮探索和反复编译,但企业每天可能产生数千次代码提交,如果每个任务都需要长时间推理和大量执行资源,再高的检出率也很难覆盖全部流水线。

安全Agent进入生产环境的第二道门槛是对新漏洞的泛化能力。历史漏洞复现通常会提供较明确的漏洞描述,而真实审计往往没有根因、文件位置和补丁线索;系统必须先发现未知问题,再自行构造验证证据,这比根据描述复现已知漏洞更难。

安全Agent进入生产环境的第三道门槛是环境稳定性。真实企业项目包含私有依赖、内部构建系统、微服务调用、数据库状态和权限限制,代码并不总能在标准容器中顺利编译,Agent也未必能获得完整生产数据进行验证。

因此,深信服接下来最值得披露的不是更多口号,而是四类工程数据:单任务平均耗时、平均推理与执行成本、不同漏洞类型的成功率,以及在无漏洞代码上的误报率。只有这些数据齐全,企业才能计算它是在替代人工审计,还是增加了一套昂贵的新工具。

国产安全模型的胜负手已经转向系统工程

Sangfor AI这次成绩说明,安全模型竞争正在从“谁的模型更会回答安全问题”转向“谁能把模型、工具和验证环境组成可靠系统”。基座模型决定推理上限,但代码索引、上下文管理、并行探索、编译反馈、沙箱执行和证据校验决定了这个上限能否转化成完成率。

GLM-5.2在这里扮演的是发动机,而Agent Swarm、漏洞环境和验证链路组成了整辆车。只比较发动机参数无法解释86.3%的结果,同样,只靠复杂工作流也无法弥补基座模型在长上下文理解和多阶段推理上的明显短板。

这次登榜对深信服的最大价值,是证明其国产技术栈已经能在高难度公开靶场中完成规模化漏洞复现。它距离“自动发现并修复企业所有漏洞”仍然很远,但1507项任务中完成1301项,至少把国产安全Agent从演示阶段推进到了值得认真验证工程成本与生产效果的阶段。

对行业而言,真正的分水岭不会是某次榜单名次,而是谁先把这种能力以可接受的成本嵌入日常研发,并在半年、一年的真实项目中持续降低高危漏洞数量。CyberGym给了Sangfor AI一张足够亮眼的入场券,接下来要看的,是它能否把1301次靶场成功变成企业流水线里的稳定结果。

参考来源

其余事实与数据参考深信服于2026年7月披露的评测结果、36氪7月相关快讯,以及CyberGym论文公开实验数据;因文末链接域名限制,未列出对应站外链接。

相关推荐

查看全部