桃子桃子快讯
返回首页
研究论文

DeepMind 模型登顶 CyberGym 漏洞发现基准

DeepMind 称其模型在 CyberGym 自主漏洞发现基准排名第一,并在 Chrome 真实代码库中产出 2.6…

2026.09.03 · 周四2 分钟阅读

Google DeepMind 近日在 X 平台发布消息,宣布其 AI 模型在衡量自动化漏洞发现能力的基准 CyberGym 上排名第一,并在 Google Chrome 代码库的真实测试中产出了 2.6 倍于对比方案的有效修复。这一结果被 DeepMind 作为模型在「自主发现弱点」与「保持速度与效率」两方面兼具能力的证据。

CyberGym 基准表现领先

DeepMind 表示,其模型在 CyberGym 等基准测试中处于领先位置。该基准聚焦于评估 AI 系统在软件环境中自主识别安全弱点的能力,考察从阅读代码到定位潜在漏洞的完整链路。DeepMind 同时强调,模型在追求高准确率的同时,并未以算力代价换取性能,推理速度与资源效率仍保持在可接受范围。

Google Chrome 真实代码库验证

除基准排名外,团队将模型部署到 Google Chrome 的实际代码库中进行端到端测试。在该测试中,模型生成的有效修复数量达到对比方案的 2.6 倍。DeepMind 将「更多有效修复」解读为:模型产出的修复更可能被安全工程师采纳并合入主线,从而缩短从漏洞发现到补丁上线的周期,加快软件防护的迭代速度。

自动化安全修复的工作流

从发布描述来看,DeepMind 的系统覆盖了「自主定位弱点」到「生成修复」的完整链路,与传统静态扫描加人工审计的模式形成对比。理论上,自动修复可直接以补丁形式合入代码,减少安全团队在排查和修补阶段的重复劳动。但本次披露并未公开模型的名称、参数量、训练数据来源、对比对象的具体身份,也未披露 Chrome 测试中纳入的代码范围与评审标准,因此模型的真实适用范围仍难以独立判断。

意义与局限

对浏览器及大型 C++ 代码库这类长期被高危漏洞盯上的项目而言,自动化漏洞修复的价值在于压缩响应窗口、降低人工审计压力。但本次披露仅源自一条 X 帖文,缺少技术报告、论文或可复现的实验细节,DeepMind 是否会随后公开模型权重、API 接入方式或完整 benchmark 数据,目前尚无明确时间表。建议将本条视为方向性信号,而非可直接落地的产品评估依据。

信源