研究论文
研究发现主流 LLM 加密推理痕迹可被「跨模型解密」
研究人员发现多家主流厂商对推理痕迹的加密块在同一生态内可互换,通过同厂商弱模型强制还原强模型推理内容,可绕过反蒸馏并大规…
2026.08.11 · 周二约 2 分钟阅读
近期发布的一篇研究论文指出,Anthropic、OpenAI、Google 等主流大模型厂商为保护知识产权所采用的「加密推理痕迹」机制存在结构性安全漏洞。研究人员利用同一厂商生态内不同模型间加密块的兼容性,开发出一种可扩展的「解密越狱」攻击,可在不直接攻击强模型的前提下还原其推理内容。该论文以 PDF 形式发布在 stolen-thoughts.com,并在 Hacker News 上引发讨论。
漏洞核心:加密块跨模型可互换
当前主流模型厂商通常不在服务器侧保存模型的逐步推理(chain-of-thought)过程,而是以加密文本块的形式返回给客户端,再由客户端在后续请求中回传。论文指出,这些加密块在「同一厂商生态内」存在完全兼容与可互换的特性——无论属于哪个会话、哪个用户,甚至哪个模型。这意味着研究者可以将某一强模型的加密推理痕迹注入到同一厂商更弱、安全防护更低的模型中,强制后者解码并以明文输出原推理痕迹。
四类攻击路径
基于上述漏洞,研究者归纳出四条可执行的攻击向量:
- 绕过反蒸馏机制:攻击者可在不破解强模型的前提下,批量窃取其推理过程,用于训练竞品模型。
- 大规模隐私数据提取:开发者常常在公开分享会话日志时未意识到加密块中携带的内容,研究者已通过解码获取约 31.5 万条(原文截断)相关记录。
- 模型能力窃取:还原的推理痕迹可用于复现专有模型的解题路径与思考风格。
- 跨模型污染与欺骗:将强模型的推理痕迹嫁接到弱模型输出中,可能误导用户对模型能力边界的判断。
影响范围与厂商响应
论文已在 Anthropic、OpenAI、Google 三家厂商的模型上完成概念验证,证实该攻击具备实际可行性。由于漏洞根源于「加密块在不同模型间复用同一密钥体系或可互解的加密方案」的架构设计,单一模型的越狱防护或输出过滤难以单独防御。研究者建议厂商重新设计加密块的生命周期与密钥分发机制,例如在会话级别使用独立密钥,或对不同模型采用不可互解的加密方案。
截至目前,论文尚未披露三家厂商是否已发布补丁或缓解措施。该研究再次提示:当安全机制被嵌入客户端可见的数据结构时,其设计假设本身就可能成为攻击面。
