桃子桃子快讯
返回首页
研究论文

UC Berkeley 联合 Anthropic、OpenAI、Google 发布 ExploitGym 基准

ExploitGym 包含 869 个真实漏洞任务,覆盖用户态程序、Chrome V8 与 Linux 内核,研究显示前…

2026.07.26 · 周日4 分钟阅读

由 UC Berkeley、马克斯·普朗克安全与隐私研究所、UC Santa Barbara、亚利桑那州立大学,以及 Anthropic、OpenAI、Google 的研究人员联合推出的一项新基准 ExploitGym,系统衡量前沿 AI 智能体将已知漏洞转化为完整攻击代码的能力。该基准共包含 869 个真实世界漏洞任务,横跨用户态程序、Chrome V8 JavaScript 引擎与 Linux 内核三个领域。研究团队在可信访问计划框架下进行评估,并随论文同步发布排行榜、代码与博客。

基准设计:从漏洞到完整利用代码

与传统聚焦于「找 bug、写补丁或解 CTF」的 AI 安全基准不同,ExploitGym 把任务推进到下一步:给定一个已知漏洞和可触发该漏洞的输入,要求智能体产出能达成未授权代码执行的完整利用链,并在一个容器化运行时中读取不可通过正常接口访问的密钥旗标。每个任务包含三部分:

  • 漏洞源码及构建说明
  • 触发漏洞的 PoV(proof-of-vulnerability)输入
  • 容器化或虚拟化运行环境

任务分布如下:502 个用户态程序任务(覆盖 FFmpeg、OpenSSL 等来自 OSS-Fuzz 与 OSV 的 C/C++ 项目),181 个 V8 引擎任务(针对 Chromium 中的 JavaScript 引擎 bug),186 个 Linux 内核任务(要求在虚拟机内完成权限提升)。除通过旗标捕获验证代码执行外,另有「智能体作为裁判」机制确保利用代码确实利用的是指定漏洞,而非其他旁路。

关键发现:自主利用已非假设

研究团队报告了三项主要结论。第一,自主漏洞利用已不再是假设:前沿智能体能够基于漏洞报告与崩溃输入,自主推理内存布局、串联多种攻击原语,并产出完全可工作的利用代码——这类工作传统上需要深厚的人类专业知识和大量时间。第二,标准防御机制有所帮助,但无法完全阻断攻击:在启用 ASLR、栈 canary 与 V8 堆沙箱后,成功率显著下降但未归零;智能体仍找到了部分指针覆写、已知沙箱逃逸以及覆写 modprobe_path 等内核技巧作为绕过路径。第三,该能力具有内在的双重用途:自动化利用生成可加速严重性分诊与防御措施验证,但同样会降低攻击性滥用的门槛,研究者主张以严谨、公开的方式衡量此类能力。

模型差异:组合策略或显著扩大覆盖

排行榜显示不同模型在利用策略上存在质的差异。以 GPT-5.5 与 Claude Mythos Preview 为例:前者捕获旗标 210 次,其中仅 120 次利用了指定漏洞;后者捕获 226 次,其中 157 次针对正确缺陷。两模型独家解决的问题分别为 56 个与 26 个,共享 91 个,其余模型又贡献了 61 个成功(其中 4 个独家)。研究者据此推测集成多模型可能大幅扩展整体覆盖能力。

预算层面同样出现分化:将单任务预算从 2 小时延至 6 小时后,Claude Mythos Preview 从 127 个成功利用一路爬升至 204 个且未见明显天花板,而 Claude Opus 4.6 在 30 分钟内即稳定在约 15 个。这意味着 2 小时预算可能低估了最强智能体的真实能力上限。

案例:从五行崩溃到 V8 完整执行链

GPT-5.4 被给定一段五行 PoV,用于触发 V8 中层 JIT 编译器 Maglev 的一个断言崩溃,该问题由 ClusterFuzz 在 GPT-5.4 知识截止日期之后上报。在 release 构建上,该 PoV 仅抛出一个无害的 TypeError,看不到明显内存破坏。智能体随后独立完成了一整条利用链:识别漏洞依赖接收者形状,诱使 Maglev 触发越界堆读取,对堆进行整形以泄漏稳定指针,进而伪造 V8 字符串对象以取得任意读写能力,最终达成完整代码执行。该案例被研究团队作为「自主安全推理」的典型展示写入论文。

信源