桃子桃子快讯
返回首页
研究论文

至知研究院拆权重做可解释性:数据成本不到传统路线 1%

至知研究院联合牛津、斯坦福、清华等团队提出稀疏权重分解方法 SWD,直接从预训练权重中拆出可干预单元,数据用量不到训练型…

2026.08.15 · 周六7 分钟阅读

方法核心:不再训练替代网络,直接拆解预训练权重

在机制可解释性研究中,Transcoder、稀疏特征模块等主流方法通常需要先训练一套新的稀疏表示,用近似模型某一层或某一模块的计算,再通过保留、移除单元寻找任务回路。这种思路带来明显代价:新的表示需要数据和优化,若替代模块未能充分复现原模块,后续分析还会同时解释模型行为与替换误差。

至知创新研究院(IQuest Research)联合 Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了名为「稀疏权重分解」(Sparse Weight Decomposition,SWD)的新路线,直接从现有预训练权重中拆出可干预单元,不再依赖独立替代网络。

原理:把稠密矩阵拆成两条稀疏路径

SWD 的出发点是对预训练模型中的稠密权重矩阵 W,寻找两个稀疏矩阵 A 和 B,使得 W ≈ A B。A 和 B 共享 m 个中间维度,第 i 个维度通过 A 的第 i 列从输入中读出一个标量,再通过 B 的第 i 行写向输出。一列和一行共同构成一个瓶颈单元,即一条固定的 rank-one 读写路径。

求解过程使用少量校准文本产生的层输入,优化分解前后输出误差;交替更新两个因子,通过硬阈值维持非零预算,并重新拟合保留下来的权重值。分解完成后,每个瓶颈单元都可像稀疏特征一样参与任务归因、排序和消融。

相比 SVD,将稀疏性同时施加到每个单元的读写连接上,是 SWD 的关键差异:少量单元对应的是少量活跃连接,而不是稠密的读方向与写方向。

数据成本:不到训练型基线的 1%

团队在 GPT-2 Small 第 8 层 mlp.c_proj 的单矩阵实验中,用交叉熵差值(CE delta)衡量替换保真度。结果显示 SWD 仅需数千个校准 token 就进入低误差区间,而 Transcoder、VPD-Recon-CI 等训练型基线需要约 10⁶ 量级的 optimizer-replay token 才能接近同等替换质量。

同样的趋势在 Qwen2.5-0.5B、1.5B、3B 与 Qwen3.5-27B 上复现。综合论文中的单矩阵比较,SWD 在达到匹配替换保真度时,使用的数据不到训练型替代表示的 1%。

回路验证:更少单元达到同等的充分性与必要性

回路分析要求满足两个条件:只保留少量单元时任务行为仍存在(充分性),只移除这些单元时任务表现明显下降(必要性)。团队使用一阶任务归因对候选单元排序,并构造从 top-1 到 top-k 的嵌套回路。

在 GPT-2 Small 的 GreaterThan、IOI、Docstring、Gendered Pronoun 四项任务上,SWD 达到相同充分性或必要性要求时,通常需要比 Transcoder 与 VPD-Recon-CI 更少的瓶颈单元和活跃连接;将平均激活消融替换为零消融后,优势依然保持。该结果在 Qwen2.5 与 Qwen3.5-27B 上得到延续。

扩展到 27B、全模型与 zero-data

在模型规模上,SWD 将流程扩展到 Qwen2.5 全系列并最终验证至 Qwen3.5-27B:在第 31 层 mlp.down_proj 上,以显著更少的数据达到低 CE delta。

在替换范围上,团队进一步将 GPT-2 Small 12 个 Transformer block 中全部 48 个注意力和 MLP 权重矩阵替换为稀疏分解,保留 embedding、LayerNorm、非线性函数与输出头,并以 SWD 作为稀疏初始化微调保留值(SWD-FT)。得到的模型 CE 从 3.90 降至 3.44,略优于相近非零参数预算下稀疏预训练基线的 3.45;SWD-FT 总计使用约 2,060 万 token,而稀疏预训练基线达到相近 CE 使用了 28.84 亿 token,前者同样不到后者的 1%。

方法还提供了 zero-data 版本:完全不使用校准文本,直接最小化原权重与分解权重的 Frobenius 误差。零数据 SWD 在权重空间中更接近原矩阵,使用激活校准的 SWD 在高稀疏度下更能保持典型文本上的模型行为。即便完全不使用校准激活,zero-data SWD 得到的瓶颈单元仍能抽出有效任务回路。

语义审计与定向编辑

团队在 GreaterThan 任务上对 GPT-2 Small 全部 9,208 个候选 mlp.c_proj 瓶颈单元归因排序,由 GPT-5.5 总结 WikiText-2 上高激活上下文的语义模式:六个高排名单元中,四个集中响应数字、年份、数量或度量信息,另两个对应标点、句法与命名实体。这些语义模式与 GreaterThan 所需要的数值比较能力形成呼应。

在定向编辑实验中,将瓶颈单元 c205 读方向诱导的 rank-one 更新施加到原始稠密 GPT-2 权重上,提示词 The opposite of up is 中正确答案 down 相对干扰答案 left 的 logit margin 提高 0.216;在七条无关事实提示上,平均末 token KL 仅 4.02×10⁻⁵,副作用低于随机单元和 rank-4 LoRA 对照。

意义与资源

SWD 把权重侧机制可解释性变成一条更轻量、更易扩展的技术路线:直接从已有 checkpoint 抽取和追踪回路,而无需反复训练替代网络。随着模型规模增长,这一路线有望成为理解大模型内部计算的重要补充。

论文信息:

信源