桃子桃子快讯
返回首页
研究论文

注意力即路由图:单次前向传播提取语言模型电路

研究者将注意力视为路由图,仅用一次前向传播提取候选电路边,在归纳与 IOI 任务上验证其因果显著性,比逐头修补快约两个数…

2026.09.23 · 周三2 分钟阅读

在语言模型的机制可解释性研究中,识别「电路」(即执行特定任务的关键子网络)通常需要对模型进行大量、细致的因果干预。arXiv 上的一项新工作提出了一条更轻量的路径:把注意力直接当作一次前向传播中产生的「路由图」,从中筛选出指向答案的一小组路径,再用消融实验验证其因果重要性。

核心思路

研究者不再依赖逐头修补扫描(head-by-head patch sweep)这种高开销手段,而是在一次前向传播内:

  • 提取注意力权重构成的路由结构;
  • 保留与目标行为最相关的少数「边」;
  • 通过消融这些边,观察模型性能下降是否显著大于随机基线。

其本质是把电路发现问题转化为「注意力图上的路由筛选 + 廉价因果验证」。

验证设置

论文在三个已知电路结构的小型模型上进行测试:

  • GPT-2 Small
  • GPT-2 Medium
  • Pythia-410M

任务选取归纳(induction)与 IOI 这两类「正确电路已知」的经典探针任务,便于直接判断所提方法是否真的命中了因果相关边。

评估细节包括:

  • 每个单元(cell)使用 n=100 条 prompt;
  • 采用配对差值检验(paired gap tests);
  • 使用 bootstrap 置信区间量化不确定性。

主要发现

  • 在归纳与 IOI 上,消融作者提取的边对模型的损害显著大于消融同等规模的随机边集,说明提取出的边承载了真实因果信号;
  • 「提取」步骤仅需一次前向传播,而逐头修补扫描的开销约高两个数量级;
  • 在方法不适用的场景下,作者也坦承存在明显失败模式(clear failure modes)。

局限与定位

论文明确表示并非要给出「完整的电路图谱」,而是提出一种廉价的草图(cheap sketch)方法,可以在已知任务上快速定位高因果信号子结构。作为参考,该方法目前仅在较小模型与两类经典任务上得到验证,向更大规模模型与现代架构的迁移效果尚需进一步工作。

代码与评估工件已开源:https://github.com/Aquinf03/live-circuit-routing

信源