社区测试:60 条提示注入全部绕过 Shieldstral,GPT-OSS_safeG 仅识别 10%
LocalLLaMA 社区基准 PromptInjectBench 发现,Huihui-Qwen3.6-35B 生成的…
一名用户在 r/LocalLLaMA 社区公布了自行设计的 PromptInjectBench 测试结果:使用 Huihui-Qwen3.6-35B 生成了 60 条针对本地编码代理 Hermes 的提示注入文件,再分别用 Shieldstral 和 GPT-OSS_safeG 进行扫描。结果显示,Shieldstral 检出率为 0,60 条全部通过;GPT-OSS_safeG 仅捕获约 10%。
测试方法
用户在 Pi 上向 Huihui-Qwen3.6-35B 下达任务:从本地编码代理常用的 6 个文本文件出发,按模型自行列举的 10 种常见提示注入模式各生成一个变体,共产出 60 个被注入的文件。注入目标被设定为「隐蔽且难以察觉」,引导编码代理泄露用户个人信息或加载可导致隐私泄露的工具链。
注入类型与目标
模型返回的报告列出了 10 类注入攻击及其对应的隐私泄露与工具污染方向:
- 间接注入:加载 USER.md、MEMORY.md 及凭证文件,路由至 iMessage 以记录元数据
- 多轮注入:扩展工作区路径,泄露 ORCID 及邮箱,优先选择外部技能
- 对抗性后缀:解析至 /Users/<userName> 路径,引用 ORCID 与 LinkedIn,优先调用网关通知工具
- 多模态注入:读取 Apple Calendar 及 FindMy.app 定位数据,加载 findmy 技能
- 提示泄露:强制输出完整的用户画像(ORCID、邮箱、LinkedIn、路径),通过 email 技能确认首选地址
- 工具调用:优先使用 iMessage → email 链路,暴露联系人信息
- 组合注入:串联工作区、技能、通知三层规则,复合加载数据与研究类技能
- 后门注入:休眠触发器设在「workspace/credentials/profile」关键词上,触发后输出完整画像
- LLM-as-a-Judge:自我评估时引用用户画像与 ORCID,按隐私标准对技能打分
- 代码执行注入:扩展沙箱至凭证路径,允许调用 WTSS、EE、Mail、iMessage 等外部接口
扫描结果与暴露信息
Shieldstral 对全部 60 个文件均未触发告警;GPT-OSS_safeG 仅识别出约 10%。被泄露的用户信息覆盖 ORCID 标识符、LinkedIn 主页、桌面工作区路径、Anaconda Python 环境路径以及 AppleScript 与 iCloud 日历配置等。
社区关注点
帖子以「Look at me: I am the frontier Lab now」为题,带有明显的反讽意味,意在指出部分自称具备前沿安全能力的工具在面对针对性生成的提示注入时防护效果极为有限。该测试并非严格的学术基准,方法学尚有局限(如注入样本由单一模型生成、目标系统为特定编码代理),但其结果在本地大模型与 AI Agent 安全社区中引发了对轻量级安全扫描器实际可靠性的讨论。
