研究发现可完全解码 Claude 与 GPT 隐藏推理过程
一篇新论文揭示了从 Claude 和 GPT 等专有模型 API 中提取隐藏推理 token 的漏洞,引发关于基准测试公…
近日,一篇题为《Stealing Reasoning Traces from Proprietary LLM APIs》的论文在社区流传,揭示了 Claude 与 GPT 系列模型 API 中的一个安全/实现漏洞——研究者成功提取了这些模型在推理过程中产生的完整推理 token。这意味着原本对外不可见的「思维链」内容可以被外部观察者读取。
这一发现迅速在 r/LocalLLaMA 等技术社区引发讨论,因为它触及了当前 AI 行业的几个核心议题:闭源模型的真实能力评估、开源模型与前沿模型的真实差距,以及潜在的模型蒸馏路径。
基准成绩可能被高估
论文给出的推理样本中,包含了一个值得关注的细节:在 AIME 等知名基准测试的题目上,Claude 的推理过程显示它「早就记住了答案」。这意味着基准榜单上闭源模型对开源模型的领先幅度,可能并非完全来自泛化能力,而是部分来自对测试集的预先记忆。
- 闭源模型在公开基准上的跑分优势,长期被作为「模型更强」的证据;
- 如果模型能直接回忆答案,跑分与「智能」之间的关联就需要打折;
- 这对依赖基准排名做选型的开发者和企业而言,是一个重要的提醒。
开源模型的「奇怪推理」并不奇怪
许多开源模型用户都曾注意到,模型在推理时会出现语义不通的奇怪 token,或者陷入反复验证已知结论的「过度思考」现象。新论文展示的样本显示,Claude、GPT 等前沿模型同样存在大量类似模式——也就是说,「奇怪的推理痕迹」并非开源模型的独有缺陷,而是当前推理范式下的普遍现象。
这一观察一定程度上缓解了开源阵营的焦虑:在 token 层面,开源模型的表现未必比闭源模型更「笨」。
关于蒸馏与中美差距的讨论
社区中也有讨论认为,此前该漏洞长期存在,可能被用于将闭源模型的推理能力蒸馏到其他模型中;一旦漏洞被修复,这条蒸馏路径也会随之收窄。但目前这只是社区层面的猜测,尚无确凿证据。论文作者也并未在已公开的材料中对这一话题作出明确表态。
如何看待这篇论文
综合来看,这篇论文的价值不在于披露某项具体技术指标,而在于提供了一扇「窗口」,让研究者和开发者第一次能够系统性地观察闭源推理模型的内部行为。对基准公平性、模型蒸馏、开源竞争力评估等议题而言,这些真实样本是难得的一手素材。
不过需要指出的是,目前该论文的主要传播渠道仍是学术预印本与社区讨论,论文本身的同行评审状态、作者背景以及方法细节仍有待在更多渠道核实;社区中关于「中国长期利用此漏洞进行蒸馏」的判断,目前还停留在推测阶段。
