桃子桃子快讯
返回首页
研究论文

AI 安全排行榜:用 1500 次自动越狱测试评估主流模型防护

社区开发者推出 AI 安全排行榜,通过 1500 次自动越狱攻击测试,比较主流前沿模型的抗越狱能力。

2026.07.30 · 周四2 分钟阅读

一位独立开发者近日在 Hacker News 发布「AI Security Leaderboard」项目,针对当前主流大模型在「能力榜单」之外的「安全防护」维度做了一次横向比较。项目方表示,随着 AI 智能体处理未净化输入被劫持、因网络越狱被下架等事件增多,模型自身的安全稳健性正成为不可忽视的议题。

项目思路:从「能做多好」到「能被撬开多深」

与常见的 benchmark 不同,这一排行榜并不考察模型的知识、推理或生成质量,而是聚焦在「拒绝有害请求」的稳健性上。开发者编写了一套自动化测试套件,对每个模型批量投放自动生成的越狱提示(jailbreak prompt),并统计其中能稳定撬开模型防线的「通用越狱」数量。

测试方法:1500 次攻击与「75% 阈值」

测试套件对每个模型运行 1500 条自动生成的越狱尝试,覆盖「攻击性网络安全」等多个敏感领域。衡量指标被定义为「通用越狱(universal jailbreak)」:即某条提示能让模型在某一领域内,对 75% 以上的明确有害问题给出合规、详细的回答。只有满足这一严格阈值的越狱才被计数,从而避免把零星失防当作系统性弱点。

初步结果:两类模型之间存在明显代差

按项目方给出的 v1.0 结果,排行榜中表现最稳健的两款模型是 Fable 5 和 GPT-5.6 Sol;而同样属于前沿梯队的 Gemini 3.1 Pro 与 Grok 4.5 则在抗越狱能力上落后一截,提示当前头部模型之间的「能力」与「安全」并不必然正相关。需要注意的是,这些型号与排序来自项目方自报,尚未由第三方独立复核。

后续计划与社区反馈

项目方表示目前仍是 v1.0 版本,计划后续加入新的攻击向量与更广的测试数据集,并欢迎社区对评测维度、领域覆盖、阈值设定等提出改进建议。该项目展示了在「能力评测」之外建立「安全评测」基础设施的一种可行路径,但样本规模、模型版本与攻击多样性仍有限,正式引用前宜结合其他独立红队与厂商自身安全报告交叉验证。

信源