桃子桃子快讯
返回首页
工具

Reddit 用户自建渗透测试基准,瞄准真实基础设施

r/LocalLLaMA 用户 TomatoWasabi 公布自研 LLM 渗透测试基准,针对实际活体基础设施而非已知漏…

2026.08.31 · 周一2 分钟阅读

近期将大语言模型与 AI 智能体用于渗透测试(pentesting)已成为业内常见做法,但如何横向比较不同模型在这一场景下的真实能力,一直缺乏公认标准。Reddit 用户 TomatoWasabi 在 r/LocalLLaMA 板块发文,公开了自己搭建的一套面向渗透测试的 LLM 基准,并阐述了其与既有方案 CyberGym 的差异。

背景:CyberGym 的定位与局限

据作者介绍,CyberGym 是当前较为知名的 LLM 安全评估基准,但其设计重心更偏向"智能体与工具链能力"的展示,而非模型本体在渗透任务上的横向对比。此外,CyberGym 主要考察模型对已知漏洞(如 OSS-Fuzz 报告中的 bug)的 PoC / 利用代码复现能力,覆盖的也不是当下最受关注的新一代模型。

新基准的核心思路

TomatoWasabi 强调,自己搭建的基准定位是"真正面向渗透测试":

  • 模型被交付一套实际可访问的基础设施,需要主动发现并利用漏洞,而非复现一个已公开的 CVE。
  • 不预先告知漏洞类型,更接近真实红队 / 渗透任务的工作流。
  • 目标是直接比较不同 LLM 在真实攻防场景中的能力差异,而非测评单一 agent 框架。

当前状态与说明

作者表示,该项目最初是为个人选型而做,后决定公开分享。原文并未公布:

  • 已纳入测试的具体模型清单;
  • 测试用例数量与基础设施规模;
  • 各模型的胜率 / 成功率 / 步骤数等量化指标;
  • 评测方法学、提示词设计及防作弊机制。

也就是说,这则帖子本质上是一份"项目预告 + 工具链接分享",并非一篇含数据的评测报告。社区若有进一步兴趣,需自行点击作者给出的链接获取详情。整体来看,该工作对 AI 与安全交叉领域有一定参考价值,但在缺乏量化结果与方法学披露之前,行业参考意义有限。

信源