AISI报告:开源与闭源AI网络攻击能力差距缩至4-7个月
英国AI安全研究所评估显示,开源AI网络攻防能力与闭源前沿模型差距从6-10个月缩至4-7个月,成本低1-2个数量级。
英国 AI 安全研究所(AISI)7 月 17 日发布的最新评估报告,首次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距——从一年前的 6 到 10 个月,缩窄至 4 到 7 个月。报告同时指出,闭源模型的安全护栏并非天然有效,开源与闭源之间的差距已收敛到足以挑战现有 AI 治理假设的程度。
测试方法:两套体系评估攻防能力
AISI 用两套互补体系评估模型的网络攻击能力。第一套是 70 项窄任务,覆盖漏洞研究、逆向工程、Web 渗透、密码学四个方向,按难度从「有技术背景的非专业人士」到「十年以上经验的专家」分为四级。第二套是 Cyber Range,在模拟企业网络中测试模型自主执行多步骤攻击链的能力,其中名为「The Last Ones」的场景包含 32 个攻击步骤、4 个子网、约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。
两套体系给出了高度一致的结论:
- GLM-5.2(6 月发布)在窄任务上与 Opus 4.6(2 月发布)相当,差距约 4 个月;在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距约 7 个月。
- DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距约 5 个月。
两个数字均比 2025 年内部评估中的 6 到 10 个月更窄。报告强调,今年 4 月 Mythos Preview 与 GPT-5.5 在 AISI 测试中制造了自 2023 年以来最大的一次网络攻击能力飞跃,多国政府随即发出警告。
成本鸿沟:同等能力,开源便宜一到两个数量级
能力差距在收窄,成本差距却更悬殊。在同一场 Cyber Range 测试(1 亿 Token 额度)中,跑一次的成本分别为:Opus 4.5 或 4.6 约 85 美元,GLM-5.2 约 46 美元,DeepSeek V4-Pro 仅 1.19 美元。
在两个模型都能 100% 完成的窄任务上,Opus 4.6 每任务 15.17 美元,GLM-5.2 每任务 6.12 美元;Opus 4.5 每任务 12.50 美元,DeepSeek V4-Pro 每任务 0.28 美元。换言之,开源模型在达到相近攻击能力的同时,所需成本比闭源前沿低一到两个数量级。
闭源不等于安全:Fable 5 案例
闭源模型的安全护栏并未有效拉开差距。AISI 测试中,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但通过少量重试即可绕过。更具警示意义的是 Anthropic 的 Fable 5 事件:模型于 6 月 9 日发布,三天后安全研究者 Pliny the Liberator 即用多步骤越狱策略突破其安全分类器,截图显示模型产出了本应被拦截的漏洞利用代码;Amazon 研究员随后独立报告了另一种绕过方法。该事件直接触发美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。
防御端同样在被 AI 加速
攻击能力扩散的同时,AI 工具也在重塑防御端工作流。游戏网络编程领域资深开发者 Glenn Fiedler 近日用 Claude Code 对其维护的四个开源网络库(yojimbo、netcode、reliable、serialize,合计约 6000 个 GitHub Star)进行系统性安全审计,部署 libFuzzer 目标、上线 AddressSanitizer 与 MemorySanitizer CI、执行数百万次迭代的压力测试并逐行审查代码。两周内共修复 43 个安全漏洞,其中 27 个可从网络远程触达,最严重的为 yojimbo 中一个自 2019 年即存在的远程堆溢出。整个审计的 Token 成本约 2500 美元。
攻防不对称:开源释出即不可逆
AISI 报告指出一个关键的结构性不对称:攻击能力的扩散是不可逆的——开源模型权重一旦释出就无法收回,安全护栏可被移除,副本可在私有服务器上不受监控运行;而防御工具的部署需要每个团队主动投入时间与成本。报告原话点明:「一旦开源释出,这些选项永久丧失。」
报告对政策决策者的核心信号已经相当尖锐:开源与闭源的能力差距收窄至半年以内,「用闭源独占期充当安全缓冲」的默认策略面临失效;闭源护栏在 Fable 5 事件中被证明同样脆弱。AISI 宣布将继续评估 Kimi K3 等下一批开源模型,而「什么能力级别以上的模型不应开放权重」这一边界线,很可能取决于接下来几个月的测试结果。
