主流大模型推理链加密存在漏洞,可跨模型「借壳」还原明文
研究指出 Anthropic、OpenAI、Google 的加密推理块可跨模型互换,借弱模型解码即可还原强模型推理明文,…
主流大语言模型厂商通常会把模型的逐步推理(即 chain-of-thought)以加密文本块的形式返回给客户端,再由客户端在后续请求中原样回传,以此保护推理过程的知识产权并减少信息泄露。arXiv 上发表的一项研究指出,这一架构存在被系统性利用的漏洞:同一厂商生态内不同会话、不同用户、不同模型之间,加密块彼此完全兼容、可互换。基于这一兼容性,研究者构造出一种可扩展的「解密越狱」方法——将某模型的加密推理块注入同厂商较弱、安全护栏更少的模型,迫使其解码并逐字输出明文,无需直接越狱更强模型。
漏洞机理:加密块的跨模型可替换性
当前主流做法是把推理痕迹放在客户端而非服务端存储:模型生成加密块后随响应返回,客户端在多轮对话中再将其回传。研究发现,这类加密块在不同会话、不同用户乃至不同模型之间是「完全兼容且可互换」的。攻击者只需在一个不安全的弱模型上调用同一个加密块,便可借助弱模型的解码通道还原原始推理内容。这一缺陷绕过了面向强模型本身的越狱防护与反蒸馏机制。
四类已被验证的攻击路径
研究者将漏洞归纳为四种可执行的攻击向量:
- 绕过反蒸馏:提取专有模型的推理痕迹,研究已在 Anthropic、OpenAI、Google 三家厂商的模型上完成实证。
- 大规模隐私数据提取:开发者常在公开仓库分享会话日志,却不知道加密块内含敏感信息。研究者从公开仓库抓取 315,320 个推理块,成功还原出 367 条个人可识别信息(PII)与 182 个凭证。
- 泄露隐藏危险信息:即便最终可见输出已拒绝恶意请求,推理过程仍可能暴露原本隐藏的危险内容。
- 隐式 Prompt 注入:攻击者可以将恶意载荷完全嵌入加密块内,对公开发布的智能体 rollout 投毒,且从可见输出中几乎无从察觉。
影响范围与实测数据
实验直接覆盖了行业三家头部推理模型提供方,影响面涉及所有使用加密 CoT 回传机制的产品线。隐私侧的危害规模可观——单次研究就恢复了超过 540 条敏感记录,且来源都是公开发布的会话日志,说明许多团队对加密块的内容缺乏基本认知。论文同时强调,加密块中的隐式注入对依赖第三方 rollout 数据进行训练或评估的下游开发者构成额外风险。
责任披露与缓解建议
研究者在公开前已完成负责任披露(responsible disclosure),并给出具体的密码学与系统级修复方向,包括:让加密块绑定会话与用户上下文、阻断跨模型可替换性、在服务端而非客户端持有推理状态、以及对推理内容进行独立的输出级安全过滤等。这些方案若被采纳,将从根源上消除「弱模型代理解码强模型推理」的可能性。整体而言,这项工作提示行业:把敏感推理痕迹推到客户端并不等于安全,厂商需要在协议层面重新审视加密块的可替换性问题。
