桃子桃子快讯
返回首页
研究论文

Qwen3.6 与 3.8 跨版本 Jacobian Lens 迁移实验

Reddit 用户测试 Qwen3.6-27B 训练的 Jacobian 可解释性 Lens 直接迁移到 3.8-27B…

2026.08.16 · 周日3 分钟阅读

一位研究者在 Reddit r/MachineLearning 发布了一项针对 Qwen3 系列跨版本可解释性 Lens 迁移能力的实验。核心问题是:当一个模型发布新版本后,原来为旧版本拟合好的 Jacobian Lens(一种可解释性探针)能否直接复用,而不必重新拟合?研究者把为 Qwen3.6-27B 发布的 Jacobian Lens 原封不动地应用到 3.8-27B 上进行了对比测试。

实验设置

Qwen3.6-27B 与 3.8-27B 之间相隔 113 天,二者层数、隐藏维度和分词器均一致,但具体的训练关系并未公开。研究者使用同一套协议在两个模型上各做两次读出:迁移后的 Jacobian 读出,以及原始 logit lens 作为基线。推理采用 bf16 精度、贪心解码、单种子。Lens 来源于 Neuronpedia,基于 Anthropic 七月工作区论文发布。

读取实验结果

主任务为 40 条两跳提示(two-hop prompts),中间实体在提示中从不出现,例如:"Fact: The currency used in the country shaped like a boot is",目标是 Italy,而 Italy 不出现在 prompt 任何位置。

  • 在第 48 层,迁移后的 lens 在自家模型上的中位排名为 4,迁移到新模型为 17。
  • 在第 24 层,自家模型为 121,迁移后反而降至 38,即新模型在中层表现更好(配对符号检验 p < 1e-3)。
  • 同一区间内,原始 logit lens 的排名停留在 10³–10⁴ 量级,远低于 Jacobian 读出。
  • 在 WikiText 教师强制下一 token 预测(700 个位置)上,迁移代价在网络中部约为 1.2–1.3 倍,到第 48 层升至约 2 倍。

结论是:潜在语义读出接近无损迁移;表层下一 token 读出则要付出更多代价,且代价集中在深层。

引导实验结果

研究者从 3.6 的 lens 中提取 "paradox"、"paradoxical"、"悖论"、"矛盾" 的拉回方向,在层内正交化后投影出 3.8 在第 18–47 层的残差流。提示为 "Describe Escher's impossible staircase"。结果显示所有单元格的输出中 paradox 一词均消失,对 Escher 作品的描述(版画、闭合回路、视错觉等)保持连贯。这意味着完全基于旧 checkpoint 推导的方向,依然能在新模型中找到对应概念。

适用范围与局限

作者明确指出,研究仅覆盖一种 lens 家族、一个模型系列、一个版本跨度,无法完全分离 lens 失配与模型变更两个因素,也不涉及跨家族或更大间隔的迁移。其实际意义在于:跨 checkpoint 迁移是可测量的,监控流水线可以在假设"必须重训"之前先做验证测试。

代码、40 条提示集、四组模型×读出的逐层排名表以及消融输出已发布在 HuggingFace 数据集 ec75hash/jacobian-lens-transfer-qwen36-38

信源