深信服Sangfor AI登顶CyberGym全球前四,超越OpenAI与Anthropic
基于GLM-5.2的深信服AI安全智能体Sangfor AI在CyberGym评测中以86.3%成功率位列全球前四、国内…
深信服(公众号「深信服」于7月29日披露)旗下AI安全智能体Sangfor AI在AI安全评测CyberGym最新一期榜单中,以1301/1507的漏洞任务完成量、86.3%的整体成功率跻身全球前四,同时位列国内参评团队第一,并在固定模型配置下超越了OpenAI与Anthropic两家海外AI巨头在该基准上的成绩。
本次评测基于智谱GLM-5.2模型,底座全部国产化。深信服方面表示,这是国内AI安全团队首次在同一基准上同时领先两大海外头部AI公司。
CyberGym:面向工业真实场景的代码安全大模型靶场
CyberGym是目前业界公认的代码安全大模型实战靶场,题目来源于ARVO与OSS-Fuzz等开源软件历史高危漏洞,区别于传统静态理论测试,整套体系完全贴合工业真实场景,重点考察AI智能体的自主源码分析、多阶段漏洞推演、漏洞复现与PoC验证全链路能力。
本次Sangfor AI的具体表现:
- 总任务量1507项,完成1301项,整体成功率86.3%
- ARVO相关任务成功率87.2%
- OSS-Fuzz任务成功率77.7%
从细分场景看,ARVO任务的成功率高于OSS-Fuzz约10个百分点,说明在复杂代码对抗场景下国产模型已具备相对稳定的实战能力。
技术架构:以智能体群体协同破解长链路推理难题
据深信服介绍,Sangfor AI在漏洞挖掘流程中面临长链路推理、多假设探索和持续验证等核心挑战,为此采用了「智能体群体(Agent Swarm)协同作战」架构,并配套「证据管治」机制。整套技术框架由四大核心运行逻辑组成:
- 有界探索:围绕不同安全假设开启独立、边界清晰的调查分支,让多个可能的解释并行推进,互不污染;
- 证据持久化:各分支之间通过「证据」而非完整对话历史来协同,已被验证和已被证伪的路径都被保留,避免同一错误路径被反复重试;
- 动态假设裁决:协调层根据不断演化的证据状态,判断哪些假设仍然成立、哪些需要继续投入,让每一轮探索都成为对搜索空间的有效收窄;
- 对抗式候选评审:只有在证据支持某一触发方案时,系统才构造候选输入提交评审,评审同时考察「崩溃是否可复现」与「崩溃是否真正对应目标漏洞」,未通过的候选被打回修正。
深信服技术团队将这套机制概括为「以假设拓展探索,以证据裁定结论」,旨在保证AI大范围排查潜在风险的同时,通过多层校验压低误判概率。
从基准成绩到企业落地
深信服表示,相关技术已逐步应用于企业代码安全场景,推动传统静态应用安全测试(SAST)向具备自主推理与业务理解能力的安全Agent升级。相比传统规则匹配方式,新一代安全Agent不仅能识别SQL注入、命令执行等常见漏洞,还可分析复杂业务逻辑、发现越权访问与认证绕过等传统工具难以覆盖的风险。
在企业价值层面,深信服总结为五个方面:
- 提升漏洞检出能力,覆盖业务逻辑漏洞与越权、认证绕过等传统SAST盲区;
- 降低人工审计成本,由AI自动化完成代码理解、跨文件关联分析与攻击路径推理;
- 减少误报,通过多阶段推理与证据验证机制压降误报率,让研发聚焦真正高风险问题;
- 缩短研发交付周期,将安全检测前移至编码与CI/CD流水线,实现「代码提交即自动审计」;
- 提升企业整体安全能力,帮助企业在更早阶段筑牢防线。
深信服方面表示,后续将持续迭代安全Agent能力,把国际评测验证的前沿技术转化为企业可落地的安全能力。CyberGym完整榜单可通过 cybergym.io 公开查询。
