桃子桃子快讯
返回首页
研究论文

论文指三家头部厂商推理加密存在通用漏洞

研究称 OpenAI、Anthropic、Google 推理模型的加密思维链可跨厂商替换,绕过较弱模型安全护栏。

2026.08.13 · 周四2 分钟阅读

近期一篇论文在 Reddit r/LocalLLaMA 引发热议,指 OpenAI、Anthropic、Google 三家头部厂商的推理模型存在一类共同的安全漏洞:所谓「加密」的推理过程(thinking trace / 思考链)可被跨厂商替换到较弱的模型上,绕过原本的安全护栏。

漏洞原理

作者发现,主流推理模型输出的「思考签名」(thinking signature)本质上是经加密处理后的推理内容。由于三家厂商的加密系统使用了相同的「全局密钥」,这段加密内容可以在不同用户、不同会话、甚至不同厂商的模型之间互换。

攻击路径大致为:先从强模型(如 Anthropic 的 Opus、帖子提到的 Sol 等)获取一段加密的推理内容,再将其注入到较弱的模型(例如 Haiku 等),并要求后者逐字复述推理过程。由于密钥一致,弱模型能够成功解密并还原原始推理,从而绕过自身的对齐与内容限制。

涉及范围

  • 厂商:OpenAI、Anthropic、Google(论文中以代号形式出现,未逐一列出对应模型)
  • 模型类型:具备 thinking / reasoning 能力的推理大模型
  • 触发条件:跨用户、跨会话、跨模型均可

业内疑问

原帖作者提出了一个耐人寻味的问题:三家公司应当是各自独立研发加密与对齐系统的,却在完全相同的攻击向量下同时失效,这相当反直觉。他给出了两种猜测:

  • 各厂商是否大量依赖 LLM 辅助(vibecode)设计安全方案,最终不约而同收敛到相近的实现;
  • 这种趋同是否意味着前沿模型在系统设计层面正在趋于同质化。

信源与局限

需要说明的是,原帖给出的 arXiv 编号(2608.09867)对应的时间戳为 2026 年 8 月,目前公开渠道尚未检索到该论文的完整正文或第三方复现报告。以上结论主要依据 Reddit 用户的转述与论文摘要,仍待多源验证。该漏洞一旦被确认,将影响多家厂商对推理内容加密策略的重新设计。

信源