桃子桃子快讯
返回首页
研究论文

Hugging Face 提出量化感知修复:4-bit 模型反超 16-bit 原版

Hugging Face 发布论文提出 QAH 方法,让 4-bit 量化模型在 9 项基准中 7 项超越自身的 16-…

2026.08.25 · 周二5 分钟阅读

Hugging Face 在最新论文中提出了一种名为「量化感知修复」(Quantization-Aware Healing,下称 QAH)的训练方法。该方法将 GPT-OSS 120B 模型压缩至 60B 参数并量化到 MXFP4 后,得到的 4-bit 模型在 9 项基准测试中有 7 项成绩超过其自身的 16-bit(bfloat16)版本。换言之,经过 QAH 处理的模型比压缩前的全精度检查点更小、推理成本更低、同时准确率更高,颠覆了「量化必然降精度」的常规认知。

背景:压缩-量化-修复的三段式流程

当前大模型的高效部署通常遵循一套固定流程:先对架构做结构化压缩(削减层数、注意力头或神经元),再把权重量化到 4-bit 以缩小显存与计算开销,最后通过一轮「修复」(healing)把性能损失补回来。gpt-oss、NVIDIA 的 Nemotron 系列,以及 Hugging Face 自家的 Hypernova 60B 都采用了这一「压缩-量化-修复」的范式。

但 Hugging Face 团队注意到一个被忽视的问题:当模型同时经历了结构压缩与低比特量化之后,传统修复手段的效果究竟如何?这一问题此前几乎没有人系统研究过。

现有修复方法的局限

目前主流的修复方案有两种:

  • 量化感知训练(QAT):在前向传播中插入伪量化算子,再用任务损失继续微调。QAT 需要把已经十分昂贵的后训练流程(SFT、RLHF、Agentic tuning)全部重跑一遍,并且容易在过长的训练中出现不稳定。
  • 量化感知蒸馏(QAD):用 KL 散度把全精度教师模型的输出直接蒸馏进量化学生模型。这一做法在「仅做了量化、未做结构压缩」的场景下效果很好,因为存在架构完全一致的全精度教师。

然而,结构压缩后的模型已经改变了层数与注意力头数量,没有一个独立训练过的、与学生架构完全一致的全精度版本可用。可供蒸馏的只有被修复过的 bfloat16 检查点,而它本身就是原模型的蒸馏近似。学生向一个已经被削弱的教师学习,精度上限被天然封死。

QAH 的核心思路

QAH 的关键改动只有一点:把教师从「修复后的 bfloat16 检查点」换回「压缩前的原始全精度模型」。教师与学生不必共享架构——教师是全尺寸全精度的,学生是 60B 参数加 MXFP4 量化。由于教师输出分布与架构无关,架构不匹配并不阻碍蒸馏。学生不接触硬标签,只通过 KL 散度匹配教师的输出分布。

这一设计重新定义了量化的角色:它不再是修复完成后的有损后处理,而是一轮额外的、对原始教师的蒸馏。4-bit 学生不是在弥补量化带来的信息损失,而是在补回前一轮修复未能充分传递的知识。

QAH 还附带一个稳定性收益。KL 蒸馏把学生锁定在固定的教师分布上,学生一旦追上教师便不再有继续漂移的驱动力;而交叉熵任务损失会不断把学生推向硬标签,更容易过拟合与震荡。

为支持 32k token 长上下文训练,QAH 复用了 Hugging Face 此前一项工作中提出的分块 KL 散度损失,将 KL 计算按序列切片逐段执行,避免把完整的词表-序列矩阵全部实例化到显存中。

实验结果

团队将 QAH 应用于 GPT-OSS 120B 模型,经结构压缩得到 60B bfloat16 检查点,再在 QAH 框架下重新量化到 MXFP4。对照对象是该 60B 模型的 bfloat16 版本——已是这一架构下最强的全精度版本。

基准测试120B 教师(MXFP4)60B BF16(已修复)60B MXFP4(QAH)QAH vs BF16
AA-LCR(长上下文推理)50.035.342.7+7.4
AIME 2025(数学)80.070.776.3+5.6

(其余 7 项基准的完整数据可在原论文中查阅。)

最终,QAH 版本的 4-bit 模型在 9 项基准中有 7 项超过 bfloat16 对照组。这意味着在结构压缩后,仅靠一次重新量化加 QAH 蒸馏,模型不仅能追回量化造成的精度损失,还能借助额外蒸馏信号在部分任务上反超原全精度检查点。对于需要在显存与成本受限场景下部署大模型的团队而言,这是一条值得关注的工程路径。

信源