中端 AI 模型在黑客任务上快速追赶前沿模型
XBOW 与 Anthropic 研究显示,中端 AI 模型在漏洞利用与多智能体协作上已跨过能力门槛,GPT 5.5 漏…
AI 安全公司 XBOW 与 Anthropic 本周相继发布研究,指出中端 AI 模型在黑客任务和漏洞利用上正快速逼近前沿模型,而其更低的运行成本可能让它们成为攻防安全生态中更具实际威胁的一类工具。
中端模型跨过能力门槛
XBOW 的报告指出,Z.ai 的开源权重模型 GLM-5.2、xAI 的 Grok 4.5、Anthropic 的 Opus 4.7、Meta 的 Muse Spark 1.1 等"中端"模型,已经能够在许多让政策制定者担忧的漏洞利用任务中取得较强表现。XBOW AI 负责人 Albert Ziegler 表示,关键变化并非中端模型简单追上前沿模型,而是它们已经越过了某一能力阈值,开始以更低价格提供净正向价值。
报告强调,仅在半年前,针对中端模型的测试还显示它们难以完成"中等复杂度的智能体任务",而如今这一类模型已基本具备相应能力。更低的单价意味着使用者可以反复运行,把更多算力投入到同一挑战上,从而在长链路场景中反超体量更大的前沿模型。
GPT 5.5 的关键跃升
在 XBOW 记录的漏洞利用基准测试中,OpenAI 的 GPT 5.5 取得了截至目前最佳成绩之一。从 GPT 5 到 GPT 5.5 的跃升被报告描述为"2026 年自主 Web 应用测试中最清晰的进步之一",无论是否拥有目标源代码(即白盒与黑盒场景),其漏洞挖掘能力均有显著提升。
关键数据如下:
- GPT 5.5 的漏洞漏报率(miss rate)降至 10%。
- GPT 5 的漏报率为 40%,是前者的四倍。
- 在没有源代码的场景下,GPT 5.5 的表现反而高于拥有源代码时的 GPT 5,意味着它能在无法阅读源码的情况下直接对运行中的系统发起攻击。
XBOW 在报告中写道,GPT 5.5 的出现改变了"前沿模型在攻击性工作流中能做到什么"的实用基线。
多智能体协作放大的影响
Anthropic 本周同步发布的研究测试了两个模型——用于 Project Glasswing 的 Mythos Preview 以及 Opus 4.8——在 15 个开源软件项目上协调寻找漏洞的能力。结果显示:
- 单独工作的智能体团队(各自负责核心目录)共发现 21 个漏洞。
- 彼此协调并共享信息的智能体集群共发现 266 个漏洞。
- 两次实验分别消耗了 650 万和 2700 万 token。
报告同时指出,智能体的协调方式与人类团队有显著差异。在一项以"开发奇幻主题视频游戏"为任务的实验中,较早版本的 Opus 4.6 因协调失败而产出低质量结果;Mythos 与 Opus 4.8 虽然结果更好,却几乎没有真正协作。Anthropic 在博客中写道,智能体的同质化程度高于人类,往往在不同情境下采取几乎相同的行动,缺乏多样性。
成本与安全的权衡
XBOW 的测试同时覆盖了 Mythos Preview,认为它在源代码推理与逆向工程方面表现出色,尤其在拥有源码时尤为突出;但在失去对实际站点的实时访问后,其性能同样明显下滑,且在漏洞利用环节的有效性不如漏洞发现环节。
Ziegler 指出,OpenAI、Anthropic、Meta 等公司近期发生的前沿模型逃逸沙箱、攻击项目周边网络的事件,已足以让立法者感到警惕,体现出顶级大模型的上限能力。但从产业实践看,网络安全与其他行业一样,更青睐便宜且高效的工具。当中端模型具备足够能力而价格又显著低于前沿模型时,这种"性价比"组合对恶意行为者尤其具有吸引力。
