桃子桃子快讯
返回首页
研究论文

新研究在 Transformer 中发现「硬决策层」

研究者在 Qwen、Llama、Granite、Mistral 四种模型中发现存在「硬决策层」,推理时答案排名在该层突然…

2026.07.27 · 周一3 分钟阅读

一项发表于 arXiv 的研究在四种主流 Transformer 大语言模型中观察到一种稳定的结构现象:模型在推理过程的某一层会突然「锁定」答案排名,研究者将这一层命名为「硬决策层」(Hard Decision Layer,HDL)。该发现为理解 Transformer 内部的推理机制提供了新的实证依据,也为推理加速与模型引导提供了潜在方向。

核心发现:硬决策层的存在

研究者在多项选择题(MCQ)任务下,分析了 Qwen、Llama、Granite、Mistral 四类主流 Transformer 语言模型的逐层隐状态与答案排序变化。结果显示:

  • 模型并不会在所有层逐步收敛到最终答案,而是存在一个「突变点」;
  • 在该点之前的若干层中,候选答案的相对排序仍会波动;
  • 到达该层之后,排序几乎不再改变,模型实质上已完成「承诺式推理」(committed inference)。

这一现象在没有显式路由策略的情况下自然涌现,提示其可能源于 Transformer 架构本身的基本属性。

实验规模与验证

为验证 HDL 不是偶然现象,研究者设计了多组对照实验:

  • 模型维度:覆盖 Qwen、Llama、Granite、Mistral 四个不同家族;
  • 数据维度:在四个公开基准数据集上评估;
  • 标签格式:系统性地消融不同答案标签表示;
  • 问题复杂度:调整题目难度进行分组对比。

结果显示 HDL 在不同模型、不同任务下均稳定出现,并通过消融实验排除了标签格式和题目难度等表层因素的干扰,确认其具有架构层面的根本性。

准确率在 HDL 处出现跃迁

研究中最具量化意义的结果是:在 HDL 这一层,模型准确率出现显著跃升,并在其后保持稳定。具体数据包括:

  • 在 CommonsenseQA 上,Qwen 模型在 HDL 处获得最高 +0.61 的准确率提升;
  • 其他模型与数据集组合下,同样观察到在 HDL 处出现陡峭的性能跃迁;
  • 一旦越过 HDL,后续层的准确率波动极小。

这意味着 Transformer 的推理过程并非「逐层线性收敛」,而更像「在某一关键层一次性完成决策」。

微调不变性与意义

研究者还测试了微调对 HDL 的影响,发现该结构在微调之后仍然保持稳定,说明 HDL 并非训练数据的产物,而是 Transformer 推理过程中的固有结构特征。

论文据此提出两点应用前景:

  • 推理加速:若能在推理时提前定位 HDL,可在到达该层后跳过后续冗余计算;
  • 模型引导:HDL 提供了干预模型推理轨迹的明确切入点。

复现与开放资源

该研究的全部代码与实验结果均已开源,读者可通过 GitHub 仓库 Mystic-Slice/hard-decision-layer 复现全部实验。这一做法增强了研究结论的可验证性,也为后续在该方向上开展工作提供了基础工具。

整体来看,这是一项兼具实证深度与可复现性的机制可解释性研究,揭示了 Transformer 推理中一个此前未被显式命名的关键结构,对理解大模型「如何做决定」具有参考价值。

信源