桃子桃子快讯
返回首页
开源

无推理气泡的 4B 蒸馏模型 Trace-Inverter-4B-NoBubble 开源

研究者基于 Qwen3-4B 与 Jackrong 反演数据,蒸馏出无 Claude 推理气泡的 trace 反演器,仅…

2026.08.21 · 周五4 分钟阅读

一位独立研究者在 Reddit r/LocalLLaMA 发布了一款基于 Qwen3-4B 微调的轻量模型 Trace-Inverter-4B-NoBubble。该工作借鉴论文《How to Steal Reasoning Without Reasoning Traces》中「无摘要 trace 反演」的思路,在没有原始 Claude 推理气泡作为监督信号的条件下,恢复了接近带气泡教师模型的 trace 重建能力。模型权重、训练与评测代码已在 Hugging Face 公开。

背景与差异化思路

所谓 trace 反演,指给定一个问题与最终答案,反向生成一段合理的推理过程。这项技术的实际价值在于:很多生产环境只记录用户查询与模型最终输出,不保留中间推理链,因此无法直接用于监督微调。原论文已定义并评测了 trace 反演器,但该方案在训练时仍依赖 Claude 推理气泡。

Jackrong 先前开源了 Trace-Inverter-4B 与两组反演数据,其训练过程使用了 Claude 推理气泡作为监督。本文作者换了一条路径:直接使用 Jackrong 反演出的 trace 作为训练数据,气泡被完全剔除,对 Qwen3-4B 进行全新微调,得到 NoBubble 版本。

训练设置

  • 基座模型:Qwen3-4B
  • 训练方式:LoRA,BF16 精度,单卡 RTX 4090 Laptop(16GB)训练一个 epoch
  • 训练数据:去重后 13,428 条样本,训练使用 12,094 条
  • 输出形态:合并 LoRA 为独立 checkpoint,可直接加载

作者明确表示,这是一次「小实验」,全部流程在消费级 GPU 上即可完成。

评测结果

评测仅在 10 条确定性 held-out 样本上进行,作者强调绝对数值不具决定性,但相对趋势可参考。

模型是否含气泡Token F1ROUGE-L
Qwen3-4B 基座0.40590.2081
Trace-Inverter-4B(教师)0.68210.4276
Trace-Inverter-4B(OOD 去气泡)0.60610.3710
Trace-Inverter-4B-NoBubble(本文)0.65000.3916

新模型在无气泡条件下,F1 与 ROUGE-L 均高于同模型 OOD 去气泡版本,并逼近带气泡教师。作者给出的「Gettier 问题」定性样例显示,NoBubble 版本同样能生成结构化、分步骤的推理骨架。

局限与作者动机

作者同时披露,Jackrong 的原始 checkpoint 在 chat template 上存在非预期行为,会将 <think> 内容放入 tool call。本次评测对加载与生成路径做了修补,但未改动任何模型权重,修补细节已在仓库中记录以便复现。

模型与代码地址:https://huggingface.co/amkkk/Trace-Inverter-4B-NoBubble

作者透露,该实验源于实际生产需求:其公司某高流量任务只记录最终答案与用户查询,传统微调因缺乏推理痕迹而效果不稳定,无气泡 trace 蒸馏正好补齐这一空缺,可用于替换现有前沿模型承担该任务。

信源