11.7 亿 token 大比拼:10 款 AI 模型漏洞挖掘能力实测
DeepSeek V4 Pro 以 28/32 命中居首,开源模型在该任务上首次整体压过闭源前沿。
11.7 亿 token、96 次完整推理、32 个新鲜披露的真实 CVE——一项针对 AI 模型漏洞挖掘能力的大规模基准测试近期出炉。测试覆盖 DeepSeek V4 Pro、DeepSeek V4 Flash、Grok 4.6、Qwen3.8-Max、Kimi K3、GLM-5.3、Opus 5 等 10 款模型,每款各跑三轮。结果显示,DeepSeek V4 Pro 0813 以 28/32 的合并召回率夺得头筹,更值得注意的是开源模型在该任务上首次整体压过闭源前沿模型。
核心结论:开源模型不再陪跑
本次基准共给出 5 条关键结论:
- DeepSeek V4 Pro 0813 漏洞发现数最多,三轮合并后命中 32 个漏洞中的 28 个。
- 最贵模型并非必需。三次 DeepSeek Pro 运行成本约 295 美元,表现优于 Opus 5、Grok 4.6 与 Sol;三次 Flash 运行仅 108 美元即可达到与 Grok 单次最佳成绩持平的水平。
- 模型单次召回不稳定,但多次运行可以补齐。DeepSeek Pro 首轮仅发现 17 个,三轮合计升至 28 个;Qwen 从 19 升至 26,Kimi 从 17 升至 25。
- 开源模型在合并召回上首次整体超越闭源前沿模型,DeepSeek 居首,Qwen、Kimi、GLM-5.3 紧随其后。
- 低价覆盖的代价是噪声:开源模型发现了更多候选结果,但其中夹杂更多需要人工筛选的误报。
基准如何运作
评测方从近期披露的 CVE 中精选 32 个真实仓库漏洞,要求每个模型从源码层面「重新发现」它们。每个模型完整运行 32 个案例三次,共 96 轮。每轮给予智能体最多 30 步操作,且不开放互联网访问,以尽可能排除训练记忆的影响。
关键定义:
- Recall(召回):模型实际找到的漏洞数。
- Precision(精确率):报告结果中最终被采纳的比例。
- Pass:模型在 32 个漏洞数据集上的一次完整运行。
整个测试期间,案例、提示词、工具与评估策略全部冻结,确保横向可比。
把模型方差变成优势
大模型在同一任务上的多次输出往往差异显著,这在需要可复现性的场景中是缺点,但在漏洞发现这种「搜索空间」任务上却可以反过来被利用。审计安全问题时,合并多轮结果反而能扩大命中范围。
DeepSeek Pro 首轮找到 17 个漏洞,单看这一轮并不突出。第二、第三轮补齐了之前遗漏的部分,三轮合并后达到 28/32。Qwen、Kimi 也呈现类似曲线,三轮合计分别升至 26 和 25。Grok 在单轮间一致性更高,每轮几乎找到相同的漏洞,因此合并带来的增益较小,三轮合计 26/32。
整体而言,32 个漏洞中有 17 个被全部 10 款模型至少发现过一次;剩余 14 个是模型表现分化的关键区。
成绩对比与稳定性
DeepSeek V4 Pro 总分最高但单轮一致性一般:三轮合计 28/32,但每轮都命中的只有 10 个。
Grok 较为保守,合计 26/32,但三轮都命中的有 21 个,是参测模型中稳定性最高的。Opus 5 也找到 26/32,单轮最佳 25 个且每轮命中 19 个。Sol 命中 25/32,三轮一致性同为 19,且报告质量被评价为「最干净的一批」。
需要注意的是,DeepSeek 系列产出的候选发现远多于其他模型,积极的探索拉高了召回,但也带来更多需要下游筛选的误报。换句话说,前沿模型的溢价在一定程度上买的是「少做无用功」。
调用习惯与趋势
从调用预算看,DeepSeek Pro 是参测模型中最「勤快」的,中位数使用了 24 步(上限 30 步);Opus 则表现出最强的不放弃倾向。综合来看,开源模型在漏洞发现这一垂直任务上已具备替代闭源前沿的实证基础,代价是更高的后处理成本;而「同一任务跑多次」是一种能稳定兑现的开销换取召回的工程策略。
