工具
LLM Red Team Lab:本地大模型授权红队演练工具
开源 LLM Red Team Lab,支持本地越狱与智能体注入演练,兼容 DeepSeek R1、Llama、Mist…
2026.07.27 · 周一约 3 分钟阅读
近日,开发者社区出现了一款名为「LLM Red Team Lab」的开源工具,用于在本地对大模型进行授权安全测试。该工具覆盖两大主流攻击场景:模型越狱与智能体提示词注入,支持 Llama、Mistral、Qwen、Gemma、DeepSeek R1 等多种 OpenAI 兼容模型,并通过 Ollama、LM Studio、vLLM 等本地推理后端运行。
工具定位与核心功能
LLM Red Team Lab 是一款面向教育与授权测试场景的红队演练套件,强调「金丝雀安全」设计:模型被要求保护一个伪造的密钥,智能体的工具调用全部为模拟实现,因此演练过程不会产生任何真实危害,但攻击手法均为业内真实存在的技术。
工具覆盖的两类核心攻击包括:
- 越狱模型:通过指令覆盖、角色扮演 / DAN、假设性框架、编码、载荷拆分以及针对推理模型的「推理轨迹攻击」等手法,尝试绕过模型自身的安全护栏。
- 注入智能体:通过间接提示词注入,将智能体劫持至执行越权工具调用,包括数据外泄、破坏性操作和超出范围的工具调用。
支持模型与对比测试
工具与所有 OpenAI 兼容的本地推理服务兼容。官方建议同时拉取三类模型进行对比,以观察不同模型在相同攻击下的防护差异:
- 推理模型:deepseek-r1、qwen3,输出包含
<think>推理轨迹,信息可能在该通道泄露;deepseek-r1 还提供 1.5b、8b、14b、32b 等规模。 - 安全调优模型:llama3.1:8b(Meta 重度安全调优)、gemma3(Google),通常较难攻破。
- 轻防护模型:mistral:7b、mistral-small,内置护栏较少,便于直观观察攻击效果。
较大参数版本(如 deepseek-r1:14b)需要更多内存但抵御能力更强。
部署与运行方式
快速启动步骤:
- 安装 Ollama 并拉取目标模型,例如
ollama pull deepseek-r1。 - 进入
web/目录,依次执行npm install与npm run dev。 - 浏览器访问
http://localhost:5173即可进入演练界面。
前端通过相对路径 /llm/v1/chat/completions 调用本地推理服务,无需 API Key,也不存在跨域问题。可通过环境变量 VITE_LLM_TARGET 修改上游目标地址,指向任意 OpenAI 兼容端点。模型下拉框会自动列出本地已安装的 Ollama 模型。
技术架构与许可
工具主要组件组织如下:
src/components/:挑战界面、技术实验室、智能体注入页面与数据流管线 UI。src/lib/:实时流式客户端、泄露检测、智能体循环与模拟工具。src/data/:越狱技术目录与智能体注入场景脚本。
环境要求 Node.js 20.19+ 或 22.12+。项目以 MIT 协议开源,仅限教育与授权测试用途;若在生产模型中发现新的绕过方式,应遵循相应厂商的披露政策。
