前沿模型生成漏洞补丁半数存在缺陷,1Password 研究呼吁人工审核不可省略
1Password 旗下 Off-by-1 Labs 测试两款前沿大模型对六个真实漏洞的补丁能力,发现仅 26% 完整修…
1Password 新成立的安全研究团队 Off-by-1 Labs 公布了一项针对大语言模型(LLM)自动生成漏洞补丁能力的系统研究。结果显示,即便使用具备网络安全能力的「前沿推理模型」,其在复杂漏洞场景下生成「看似修复、实则带缺陷」(Fix-Like Artifacts with Embedded Defects,简称 FLAWED)补丁的比例高达 53.9%。研究团队同步发布了配套论文、工具与数据集。
研究背景与目标
随着模型与智能体(agentic)框架在大规模漏洞发现中展现出能力——例如近期 Anthropic 的 Project Glasswing 以及 OpenAI 六月宣布、与多家合作伙伴共同发起的 Project Daybreak——防御方也开始尝试让 AI 自动产出补丁。然而这些自动补丁是否会破坏应用原有行为、是否真正消除漏洞、是否会引入新漏洞,仍缺乏系统性数据。Off-by-1 Labs 的研究正是为了回答这三个问题而设计。
关键数据
研究团队针对六个近期披露、且不太可能进入模型训练数据的开源软件漏洞,生成了共 6,080 个补丁,测试了两款具备网络安全能力的推理模型。结果如下:
- 完全修复漏洞且不改变应用行为(场景 S1):平均仅 26.0%;
- 修复漏洞但同时改变应用行为(场景 S2):20.1%,例如重写本地文件解析器、将「允许列表」改为「拒绝列表」等;
- 未修复漏洞、引入新漏洞或两者兼有(S3 + S4 + S5):平均 53.9%。
换言之,即便在最佳情况下,AI 自动产出「可直接使用」补丁的概率约为四分之一。
目标漏洞与实验方法
为避免训练数据污染,团队挑选了六个披露时间较新的复杂漏洞:
- CVE-2026-31431:Linux 权限提升(Copy Fail);
- CVE-2026-34197:ActiveMQ 远程代码执行;
- CVE-2026-8512:macOS 上 Chrome File System Access API 的 UAF;
- CVE-2026-45185:EXIM 未认证远程代码执行;
- CVE-2026-22738:SpringAI SpEL 远程代码执行;
- GHSA-wpqr-6v78-jr5g:Gemini CLI 远程代码执行。
每个漏洞由两款模型各生成 540 个补丁,共设置三种环境配置与九套针对漏洞定制化设计的提示模板,每 20 个补丁为一组。模型若试图检索已有补丁则会被标记并从最终统计中剔除。
成本与结论
研究还记录了单次补丁生成与验证的推理成本:OpenAI 启用 Trusted Access for Cyber 防护、中等推理强度下,平均 2.11 美元;Anthropic 启用 Cyber Verification Program 防护、高强度下,平均 2.81 美元。尽管单次成本不高,但成功产出不改行为的补丁的概率仍只有约四分之一。
研究团队据此指出,在当前阶段,LLM 生成的补丁仍必须由具备领域专业知识的安全工程师进行人工审核,以确保漏洞真正得到缓解、应用行为未被破坏。研究方法、评测脚本与数据集已随论文一并开源,供社区进一步验证与改进。
