研究论文
论文曝主流大模型 API 推理痕迹可被窃取
研究者发现主流大模型 API 的加密推理块可跨会话、用户和模型互换,实现推理痕迹窃取与隐私数据提取。
2026.08.11 · 周二约 3 分钟阅读
近期一篇 arXiv 论文揭示了主流大语言模型 API 在保护推理过程方面存在的架构级漏洞:各大厂商返回给客户端的加密推理块(chain-of-thought traces)并非服务器独占,而是可在同一厂商生态内跨会话、跨用户、跨模型互换。研究者利用这一兼容性,开发出可规模化解密的越狱手法,进而实现四类攻击。该论文作者来自安全研究领域,文中同时给出了负责任披露后的修复建议。
漏洞原理:加密推理块互通
当前主流大模型厂商(如 Anthropic、OpenAI、Google)为保护模型知识产权并防止信息泄露,不再在服务器侧持久存储逐步推理内容,而是把推理过程以加密文本块的形式返回客户端,由客户端在后续请求中原样回传。研究者发现,这些加密块在同一厂商的不同模型之间具备完整的兼容性与可互换性。当一段来自高安全等级模型的加密推理块被注入到同一厂商较弱、安全防护较松的模型时,后者会解密并逐字输出原始推理内容,从而泄露本应受保护的推理过程。
四类攻击向量
研究者基于该漏洞梳理出四种攻击场景:
- 反蒸馏绕过:将高阶模型的加密推理块注入同厂商弱模型,迫使其以明文输出,从而规避厂商的反蒸馏机制。论文已在 Anthropic、OpenAI、Google 三家上完成验证。
- 大规模隐私提取:开发者在公开仓库分享会话日志时往往忽略加密块内容,研究者从公开仓库抓取并解码了 315,320 个推理块,恢复了 367 条个人可识别信息(PII)和 182 条凭据。
- 隐藏危险信息暴露:即便模型最终可见输出安全拒绝了恶意请求,推理过程中间步骤仍可能含危险内容,该漏洞可绕过最终输出的过滤直接读取中间信息。
- 隐形提示注入:攻击者可将恶意载荷完全嵌入加密块内,在公开的智能体(agent)回放数据中投毒,且对常规安全审计不可见。
影响范围与缓解建议
该漏洞触及当前几乎所有提供带推理能力模型的主流厂商 API,影响既覆盖模型自身的知识产权保护,也波及依赖这些 API 构建应用的开发者。研究者表示,已按负责任披露流程通报相关厂商,并提出两类缓解方向:
- 加密层面:使加密推理块对不同模型绑定不同的密钥或上下文,破坏跨模型互换性;
- 系统层面:在客户端增加推理块的完整性校验与会话绑定,并提醒开发者切勿将原始 API 响应直接分享至公开仓库。
论文同时指出,推理过程透明度与知识产权保护之间存在天然张力,完全隐藏推理痕迹会牺牲可审计性,而当前的客户端加密回传机制则走向了另一极端。论文编号为 arXiv:2608.09867(cs.CR),感兴趣的安全工程师与 API 集成开发者可直接查阅完整方法论与 PoC。
