arXiv 研究:线性探针能识别上下文篡改,却难以预测大模型最终是否出错
一项预注册研究发现,线性探针可近乎完美检测被篡改的上下文,但并不能可靠预测大模型在多跳推理中是否给出正确答案。
arXiv 上新发布的一项研究指出,线性探针(linear probe)能够以近乎完美的准确率检测出大模型上下文中的被篡改片段,但这种「看见错误」的能力并不能转化为对模型最终答案是否正确的可靠预测。该现象被作者称为「知而不能说」(knowing-saying gap),并强调这对实际部署中的实时监控具有直接含义。
研究设计与核心发现
研究者在多跳算术推理链上展开实验,重点考察两件事:一是探针是否能分离「正确」与「错误」的最终输出;二是不同干预策略对模型表现的影响。他们预先注册了「持续性优于峰值」(persistence beats peak)假设,即探针在多跳链路中持续检测到篡改的信号应比单跳的峰值信号更能预测失败。然而实验结果反驳了这一假设:探针是否在多跳中持续报错,并不能可靠地区分最终答案的正误。
与此同时,研究还观察到:当模型被强制以结构化格式输出置信度时,输出会坍缩为两个值,且这两个值对应的错误率几乎不可区分,意味着「说出来」的置信度同样不能作为可靠信号。
跨模型与跨推理范式的迁移性
作者表示,这种「探针能识别篡改、却无法预测正确性」的脱节在多种模型家族上是一致的,包括专门面向推理任务的模型。这意味着问题并非特定架构的偶然现象,而是与现有语言模型内部的表征—行为关系有关。
实时干预:模型相关、错误类型相关
若将探针信号用作实时干预依据,不同策略呈现明显差异:
- 分支再选(branch-and-pick):在多个模型上整体为净收益,并在 Llama-3.1-8B 上是唯一「不破坏正确推理」的策略,救回 4 例错误、破坏 0 例。
- 重新提示(reprompt) 与 替换前文(replace-prior):破坏正确推理链的频率大致等于其救回错误输出的频率,整体收益并不显著。
部署含义
作者总结,探针式监控应被视为对模型「口头置信度」的必要补充,但没有任何单一干预策略能够普适地主导表现;实际可行的方案是模型相关、错误类型相关的路由策略(model-aware, error-type-aware routing)。这一结论对希望上线大模型自动纠错机制的团队具有直接参考价值。
论文编号:arXiv:2608.07528v1。
