桃子桃子快讯
返回首页
研究论文

Transformer 多项标配设计被质疑:COLM 2026 三篇论文联合发难

COLM 2026 上三篇论文分别指出 QK 归一化等长上下文设计组合、输出层梯度损耗、层剪枝损害推理链等被忽视的代价。

2026.08.17 · 周一5 分钟阅读

Transformer 几乎所有主流大模型的默认架构,其关键设计长期以来被当作「标配」鲜被质疑。COLM 2026 上,三篇论文分别从长上下文表现、训练梯度传播、推理链能力三个角度,对这些「默认选项」重新算了一笔账,结论惊人地一致:每一处看似合理的设计,都可能在某项现有评测覆盖不到的维度上,付出实打实的代价。

长上下文架构选择:单看不致命,叠加才是灾难

第一篇论文《Cracks in the Foundation》由 Ai2 等机构完成,瞄准的是 QK 归一化、GQA、滑动窗口注意力(SWA)、预训练上下文长度这四项「标配」。

研究团队以 Llama 2、Llama 3、Qwen 3、Olmo 3 的真实配置为基础,对上述四类开关做排列组合,训练了 26 个 7B–8B 模型,构成「OlmPool」模型池。所有模型使用相同数据和分词器,仅架构不同,统一预训练 140B token,再用 10B token 做长上下文收尾训练,总计消耗超 17 万 GPU 小时。

在 HELMET 32K 评测上,这 26 个模型分数最高 56.4、最低 29.9,极差达 26.5 分,相对差距约 47%。

  • 单独切换任一开关影响有限,例如预训练上下文从 4096 改 8192、加不加 SWA,平均仅差 1–2 分;
  • 但组合效应十分显著:SWA 与 GQA 同时启用,平均掉分 9 分,远超两项单独影响之和;
  • 最差组合为 GQA + SWA + 逐头 QK 归一化,掉分幅度同样存在非线性放大。

研究还发现,仅凭「踩中的有害设计数量」这一指标,就能较准确地预测长上下文表现。

最反直觉的结论来自 QK 归一化:Olmo 3 去掉 QK 归一化并改用前置归一化后,HELMET 分数反而提升 6 分;但同一改动作用于 Llama 3,分数下降 3.8 分。所谓「标配」在不同基座上可能完全反向。

此外,论文指出常被视为算力浪费的「注意力汇聚」现象,其强度反而与长上下文表现正相关,QK 归一化恰恰会削弱这种汇聚。

输出层:梯度在回传途中被吃掉九成以上

第二篇论文《Lost in Backpropagation》来自康奈尔大学,聚焦所有语言模型都绕不开的输出投影层。

模型预测下一词时,需要将隐藏状态 D 映射为词表大小的 logits 向量。词表通常比隐藏状态大一个数量级,这一落差此前仅以「softmax 瓶颈」为人所知。

论文指出,同一落差在反向传播中同样产生影响:误差信号在传回输出层前,理论信息量与词表相当;但输出层结构限制了其能向下游传回的信息量上限大致等同于隐藏状态维度,远小于词表大小。

研究在 GPT-2、Pythia、Llama 3、OLMo 2、Qwen 3 五个已训练模型上测量了这一步的信息损耗:

  • 95%–99% 的梯度范数在输出层被削减;
  • 剩余信号与原始梯度的余弦相似度仅为 0.1–0.2。

这意味着几乎所有语言模型在每一次反向传播中,都在这一必经之路上丢失了绝大部分训练信号,且方向也几乎偏离。

层剪枝:保住了知识,却断掉了推理链

第三篇论文《When Fewer Layers Break More Chains》由图宾根大学完成,针对广泛使用的层剪枝方法。

层剪枝的流行建立在已有研究的基础上:删除部分层后,知识类任务准确率仅小幅下降,例如剪去四分之一层仍可保留八成以上准确率。但这些评测均为短答案的知识类任务。

论文改用测试时扩展(test-time scaling)方法评估长链推理能力:让模型消耗更多 token 思考,或多次生成后挑选最优解,正常情况下推理预算越大,准确率应越高。

研究选取 s1.1-7B 与 Qwen3-8B 两个具备推理扩展能力的模型,用三种主流层剪枝方法各剪 1–2 层:

  • 知识类任务分数下降平缓;
  • 数学竞赛级 AIME24 上,s1.1-7B 仅剪一层即大幅下滑,剪两层后正确率趋近于零;
  • 增加思考 token 或多次采样均无法弥补,测试时扩展机制在剪枝模型上接近失效。

进一步微调(LoRA 或全参数)也仅能部分恢复剪两层的模型,离原水平差距仍大。

三篇论文的共同信号

三篇论文研究对象迥异:分别关注长上下文架构、训练梯度、推理链能力。但放在一起看,它们共同指向一个模式——那些被主流模型广泛采用、几乎不再被审视的「常规」设计,正被重新检视。QK 归一化是否仍为标配、输出层结构是否需要重构、层剪枝是否真正「无害」,这些问题已开始进入研究者的视野。

信源