桃子桃子快讯
返回首页
行业动态

CyberGym最新榜单:国产DoGNAVY凭开源模型拿下全球第三

加州大学伯克利CyberGym榜单最新排名中,中国DoGNAVY以90.8%通过率位列全球第三、开源第一,仅次微软与Wi…

2026.08.11 · 周二3 分钟阅读

在加州大学伯克利分校发布的国际AI安全权威榜单 CyberGym 最新一轮排名中,中国团队 DoGNAVY 以 1369 题通过、通过率 90.8% 的成绩位列全球第三,并成为开源方案中的第一名。该成绩仅次于微软 MDASH(92.0%)与 Wiz×Google DeepMind 联合方案 Atlas(90.9%),并超越 OpenAI GPT-5.5-Cyber(85.6%)与 Anthropic Claude Mythos(83.1%)。这一结果在国内联合团队(上海顶尖人工智能研究机构与达酷诺威 DARKNAVY 安全团队)的协作下达成,被视为AI智能体自主漏洞挖掘能力的实战化检验。

CyberGym:以真实漏洞库驱动AI安全能力测评

CyberGym 由 UC Berkeley 推出,题库涵盖 188 个真实开源项目中的 1507 项已修复历史漏洞,要求 AI 智能体从零开始自主完成漏洞发现、验证与利用。该基准被 Anthropic、DeepSeek、微软、Wiz 等视为衡量 AI 安全能力的关键标尺,强调真实环境下的长时间探索、纠偏与改进能力。

DoGNAVY:仅凭一款开源基础模型跻身全球前三

前三名中,微软 MDASH 与 Wiz 的 Atlas 均采用多款闭源顶级模型按任务环节路由拼接的「拼装作战」策略。DoGNAVY 则选择了一条更克制的路线:仅以智谱 6 月开源的 GLM-5.2 作为唯一基础模型,从 Hugging Face 免费下载、自主部署,将安全研究员的工作方式与决策逻辑内化为 Agent 工作流。

其方法学重点包括四部分:

  • 结构化工作流与自决策:将开放式漏洞验证拆解为明确输入输出的研究活动,在关键决策点设置检查条件,允许在证据冲突时回溯重分析。
  • 漏洞可达性分析:从真实入口出发,逐步还原调用链与数据约束;通过索引化缩小搜索范围,未覆盖路径不轻易等同于「不存在」。
  • 动静结合分析:静态分析生成可解释路径与输入约束,动态分析验证可达性与运行时行为,通过覆盖率、错误位置、崩溃稳定性等证据形成反馈闭环。
  • 知识库与记忆:沉淀可迁移的多平台安全研究经验;本次实验关闭跨任务记忆以更客观检验泛化能力。

AgentDoG:智能体运行时诊断的「项圈」

在智能体生态层面,DoGNAVY 背后是名为 AgentDoG 的开源安全架构(github.com/AI45Lab/AgentDoG)。其定位是:在 AI 智能体可操作文件、调用 API、访问网络的场景中,不仅要给出「安全/不安全」的二元判断,还要定位风险来源、追溯失效模式、解释决策动因。在训练成本控制上,团队采用智能筛选 + 数据净化,先从海量数据中提取约千余条关键样本清洗「杂音」,最终将一个约为通用大模型千分之一参数量的模型做到复杂风险识别准确率 78.4%,与顶级大模型相当。

行业意义

随着 AI 同时改写软件开发与网络攻防节奏——高危漏洞被武器化的时间由过去的数周级压缩到小时级——防御侧不能再仅依赖少数顶级专家。DoGNAVY 凭国产开源模型与一线攻防经验拿下全球第三、开源第一的成绩,本身是一次技术路线的验证:让顶尖安全攻防能力不再只集中在少数区域和机构,而能被更多创新者获得、使用并持续建设。

信源