桃子桃子快讯
返回首页
研究论文

亚马逊云科技提出 SDR 技术 缓解 Nova 模型微调中的推理遗忘

AWS 团队提出自蒸馏推理(SDR)方法,通过复用基模型自身思维链作为训练信号,解决 SFT 微调导致的推理能力丧失问题…

2026.07.22 · 周三4 分钟阅读

亚马逊云科技(AWS)在其机器学习博客中发表了一篇技术文章,介绍了一种名为「自蒸馏推理」(Self-Distilled Reasoning,简称 SDR)的训练方法,用于在 Amazon Nova 2 系列模型上进行监督微调(Supervised Fine-Tuning,SFT)时缓解模型推理能力的丧失。实验结果显示,该方法在保留通用能力的同时,还能带来平均超过 6.5% 的目标任务性能提升。

背景:SFT 可能让模型「忘记」如何思考

文章首先剖析了 SFT 中的「推理抑制」(reasoning suppression)现象。当训练数据只包含输入与输出对、不含中间思维链(chain-of-thought,CoT)时,损失函数会对推理 token 与输出 token 一并计算。由于缺少对推理过程的有监督信号,模型会被训练成绕过推理机制、直接给出答案的「捷径学习」行为。

这一现象的代价相当明显。文章以数学能力为例:基模型在该基准上的得分约为 70%,但经过普通 SFT 微调后,平均暴跌至 6%,即发生了严重的「灾难性遗忘」。即使在推理开关处于开启状态,模型也难以恢复原有推理水平。

SDR:用模型自己的思维链训练自己

针对上述问题,AWS 团队提出的核心思路是「自蒸馏」——复用 Amazon Nova 2 Lite 基模型自身的 CoT 推理轨迹,作为 SFT 训练数据中的推理部分补充。这一方法的关键特征包括:

  • 无需额外教师模型或后处理插值;
  • 无需人工标注 CoT;
  • 可直接作用于任何已有 SFT 数据集,不限定领域;
  • 在训练过程中引入正则化效果。

相比常见的「模型合并」(将 SFT 后的 checkpoint 与基模型按权重融合)方案,SDR 在保留通用能力方面表现更优。

实验验证:三个基准上的数据

文章在多个基准上对比了 SDR、普通 SFT 与模型合并的效果,核心数据如下:

  • 数学能力保留:普通 SFT 使数学得分从 70% 降至平均 6%;引入 SDR 后几乎完全恢复。
  • 与模型合并对比:模型合并方案数学得分约 68%,SDR 约为 70%;同时 SDR 在目标任务上的平均性能提升超过 6.5%。
  • LLaVA CoT 数据集:在不同 LoRA 合并权重下,训练与推理同时开启推理模式,相较关闭模式,目标任务性能提升最高达 17.3 个百分点(merge weight = 1.0 时为 65.17% vs 47.90%)。

与模型合并的取舍

文章指出,模型合并是一种直观的灾难性遗忘缓解手段,但它本质上是在「SFT 增益」与「通用能力保留」之间做权衡——合并权重越高,越接近 SFT 后模型,目标能力越强但通用能力损失越大;而 SDR 通过在训练阶段就注入推理信号,从源头缓解了遗忘,无需后处理插值。

实践建议

综合实验结果,AWS 给出以下建议:

  • 当 SFT 数据缺乏高质量 CoT 标注时,优先使用 SDR 而非模型合并;
  • 训练与推理阶段应保持一致的推理模式开关,以获得稳定的性能收益;
  • SDR 尤其适用于代码、数学等推理密集型目标场景。

文章最后强调,SDR 的成功与学界近期关于「自蒸馏」作为缓解灾难性遗忘机制的研究方向相吻合,为大模型定制化微调提供了一条低成本、可扩展的新路径。

信源