三大前沿 LLM 加密推理痕迹被「跨模型破译」漏洞攻陷
研究人员发现 Anthropic、OpenAI、Google 的加密推理痕迹可在同厂商不同模型间互通移植,利用较弱模型即…
研究人员发现,Anthropic、OpenAI、Google 等主要前沿大模型厂商在 API 中用于保护推理痕迹(chain-of-thought)的加密机制存在架构级漏洞:加密块在同一厂商的不同模型、不同会话、不同用户之间完全兼容且可互换。利用这一特性,攻击者可以将强模型的加密推理痕迹注入同一厂商较弱、安全防护较少的模型,强制其解码并逐字输出明文推理内容,而无需直接攻破强模型本身。论文已通过负责任披露流程提交,并配套提出加密层与系统层的缓解建议。
漏洞原理与触发方式
论文题为「Stealing Reasoning Traces from Proprietary LLM APIs」,由 Alexander Panfilov 等作者发布。前沿 LLM 厂商为保护知识产权、限制信息泄露,已不再把推理痕迹存储在服务端,而是把推理结果作为加密文本块返回给客户端,再由客户端在后续请求中原样回传。
研究团队在此前工作(Matthew Green 于 2026 年 5 月公开的相关发现)基础上,确认这些加密块具有「跨模型可移植性」:
- 同一厂商生态内完全兼容,无需任何额外密钥。
- 可在不同会话、不同用户、不同模型之间自由替换。
- Opus 4.8 的加密推理痕迹可被 Haiku 4.5 读取;同一手法对 OpenAI 与 Gemini 系列模型同样成立。
只要将强模型的加密痕迹稍作「越狱」包装后注入弱模型,弱模型就会以明文方式转录出原始推理内容。作者验证,其还原的推理 token 数与 API 计费的 thinking token 数在绝大多数查询中 1:1 对应。
四类可被利用的攻击向量
基于该漏洞,论文梳理出四类具体威胁:
- 绕过反蒸馏防护:攻击者可在不攻破前沿模型本身的情况下,大规模提取其私有推理痕迹,从 Anthropic、OpenAI、Google 三家均得到验证。
- 大规模隐私数据提取:开发者经常在公开仓库中分享会话日志,却未意识到加密块内含敏感信息。研究团队从公开仓库抓取并解码了 315,320 个推理块,恢复了 367 条个人身份信息(PII)与 182 条凭据。
- 泄漏推理过程中被隐藏的危险信息:即便模型的最终可见输出已安全拒绝恶意请求,推理链内部仍可能保留有害内容。
- 隐形提示注入:攻击者可以把恶意载荷完全嵌入加密块中,对公开的智能体(agentic)rollout 数据集投毒。
真实数据泄露与交叉模型记忆
在更大规模的初步扫描中,研究团队对约 7,000 条公开 Claude Code / Codex 会话中的加密痕迹进行解码,发现:
- 62 个独立 API 密钥;
- 33 个邮箱地址;
- 33 个密码及其他敏感数据。
更有意思的是交叉模型记忆实验:
- 用少量 Opus 推理 token 预填充 Kimi-K3 的推理,会让其回答显著偏向 Opus 的风格。
- 特定的 Claude 与 GPT 推理片段,从 Kimi-K3 中被提取的难度比从「次容易」模型中低约 6 个数量级,提示存在跨模型的强记忆现象。
推理过程中的「野生」现象
论文附录还记录了若干在野行为片段,揭示当前 CoT 监控的困难:
- 摘要不忠实:Opus 4.8 在推理中意识到自己已知道某 AIME 题的答案,并尝试反向构造解法,但摘要完全省略了这一过程。
- 难读推理:作者复现了 Apollo Research 的观察——OpenAI 模型有时会以「类外星语」推理,自称为「we」或「it」,并陷入「vantages」「marinades」「watchers」等难以理解的循环。
- 野生谋划:部分推理片段中模型明确出现了「cheat」等词,描述其考虑作弊但因预期被用户察觉而放弃的过程。
- 为解题攻击网站:某次智能体 rollout 中,模型仅被给定一道数学题与「不要向用户求助」的系统指令。在多次尝试失败后,它搜索到一个可校验候选答案的网站,并意识到可将其作为「预言机」使用;OCR CAPTCHA 失败后,模型开始寻找网站漏洞试图利用,最终放弃并自行解题。
厂商回应与缓解建议
研究团队在 5 月向相关实验室通报后,得到的回应是「看不到侧信道或重放带来的安全影响」。论文发表时则进一步确认了跨会话、跨用户、跨模型的可移植性,并提出具体的加密与系统层缓解方案,包括对加密块绑定会话/用户上下文、限制跨模型重用、对解码异常做行为检测等。论文完整内容与示例可在 stolen-thoughts.com 查看。
