桃子桃子快讯
返回首页
工具

LLM Red Team Lab:本地大模型授权红队演练工具

开源 LLM Red Team Lab,支持本地越狱与智能体注入演练,兼容 DeepSeek R1、Llama、Mist…

2026.07.27 · 周一3 分钟阅读

近日,开发者社区出现了一款名为「LLM Red Team Lab」的开源工具,用于在本地对大模型进行授权安全测试。该工具覆盖两大主流攻击场景:模型越狱与智能体提示词注入,支持 Llama、Mistral、Qwen、Gemma、DeepSeek R1 等多种 OpenAI 兼容模型,并通过 Ollama、LM Studio、vLLM 等本地推理后端运行。

工具定位与核心功能

LLM Red Team Lab 是一款面向教育与授权测试场景的红队演练套件,强调「金丝雀安全」设计:模型被要求保护一个伪造的密钥,智能体的工具调用全部为模拟实现,因此演练过程不会产生任何真实危害,但攻击手法均为业内真实存在的技术。

工具覆盖的两类核心攻击包括:

  • 越狱模型:通过指令覆盖、角色扮演 / DAN、假设性框架、编码、载荷拆分以及针对推理模型的「推理轨迹攻击」等手法,尝试绕过模型自身的安全护栏。
  • 注入智能体:通过间接提示词注入,将智能体劫持至执行越权工具调用,包括数据外泄、破坏性操作和超出范围的工具调用。

支持模型与对比测试

工具与所有 OpenAI 兼容的本地推理服务兼容。官方建议同时拉取三类模型进行对比,以观察不同模型在相同攻击下的防护差异:

  • 推理模型:deepseek-r1、qwen3,输出包含 <think> 推理轨迹,信息可能在该通道泄露;deepseek-r1 还提供 1.5b、8b、14b、32b 等规模。
  • 安全调优模型:llama3.1:8b(Meta 重度安全调优)、gemma3(Google),通常较难攻破。
  • 轻防护模型:mistral:7b、mistral-small,内置护栏较少,便于直观观察攻击效果。

较大参数版本(如 deepseek-r1:14b)需要更多内存但抵御能力更强。

部署与运行方式

快速启动步骤:

  1. 安装 Ollama 并拉取目标模型,例如 ollama pull deepseek-r1
  2. 进入 web/ 目录,依次执行 npm installnpm run dev
  3. 浏览器访问 http://localhost:5173 即可进入演练界面。

前端通过相对路径 /llm/v1/chat/completions 调用本地推理服务,无需 API Key,也不存在跨域问题。可通过环境变量 VITE_LLM_TARGET 修改上游目标地址,指向任意 OpenAI 兼容端点。模型下拉框会自动列出本地已安装的 Ollama 模型。

技术架构与许可

工具主要组件组织如下:

  • src/components/:挑战界面、技术实验室、智能体注入页面与数据流管线 UI。
  • src/lib/:实时流式客户端、泄露检测、智能体循环与模拟工具。
  • src/data/:越狱技术目录与智能体注入场景脚本。

环境要求 Node.js 20.19+ 或 22.12+。项目以 MIT 协议开源,仅限教育与授权测试用途;若在生产模型中发现新的绕过方式,应遵循相应厂商的披露政策。

信源