研究论文
注意力即路由图:单次前向传播提取语言模型电路
研究者将注意力视为路由图,仅用一次前向传播提取候选电路边,在归纳与 IOI 任务上验证其因果显著性,比逐头修补快约两个数…
2026.09.23 · 周三约 2 分钟阅读
在语言模型的机制可解释性研究中,识别「电路」(即执行特定任务的关键子网络)通常需要对模型进行大量、细致的因果干预。arXiv 上的一项新工作提出了一条更轻量的路径:把注意力直接当作一次前向传播中产生的「路由图」,从中筛选出指向答案的一小组路径,再用消融实验验证其因果重要性。
核心思路
研究者不再依赖逐头修补扫描(head-by-head patch sweep)这种高开销手段,而是在一次前向传播内:
- 提取注意力权重构成的路由结构;
- 保留与目标行为最相关的少数「边」;
- 通过消融这些边,观察模型性能下降是否显著大于随机基线。
其本质是把电路发现问题转化为「注意力图上的路由筛选 + 廉价因果验证」。
验证设置
论文在三个已知电路结构的小型模型上进行测试:
- GPT-2 Small
- GPT-2 Medium
- Pythia-410M
任务选取归纳(induction)与 IOI 这两类「正确电路已知」的经典探针任务,便于直接判断所提方法是否真的命中了因果相关边。
评估细节包括:
- 每个单元(cell)使用 n=100 条 prompt;
- 采用配对差值检验(paired gap tests);
- 使用 bootstrap 置信区间量化不确定性。
主要发现
- 在归纳与 IOI 上,消融作者提取的边对模型的损害显著大于消融同等规模的随机边集,说明提取出的边承载了真实因果信号;
- 「提取」步骤仅需一次前向传播,而逐头修补扫描的开销约高两个数量级;
- 在方法不适用的场景下,作者也坦承存在明显失败模式(clear failure modes)。
局限与定位
论文明确表示并非要给出「完整的电路图谱」,而是提出一种廉价的草图(cheap sketch)方法,可以在已知任务上快速定位高因果信号子结构。作为参考,该方法目前仅在较小模型与两类经典任务上得到验证,向更大规模模型与现代架构的迁移效果尚需进一步工作。
