无推理气泡的 4B 蒸馏模型 Trace-Inverter-4B-NoBubble 开源
研究者基于 Qwen3-4B 与 Jackrong 反演数据,蒸馏出无 Claude 推理气泡的 trace 反演器,仅…
一位独立研究者在 Reddit r/LocalLLaMA 发布了一款基于 Qwen3-4B 微调的轻量模型 Trace-Inverter-4B-NoBubble。该工作借鉴论文《How to Steal Reasoning Without Reasoning Traces》中「无摘要 trace 反演」的思路,在没有原始 Claude 推理气泡作为监督信号的条件下,恢复了接近带气泡教师模型的 trace 重建能力。模型权重、训练与评测代码已在 Hugging Face 公开。
背景与差异化思路
所谓 trace 反演,指给定一个问题与最终答案,反向生成一段合理的推理过程。这项技术的实际价值在于:很多生产环境只记录用户查询与模型最终输出,不保留中间推理链,因此无法直接用于监督微调。原论文已定义并评测了 trace 反演器,但该方案在训练时仍依赖 Claude 推理气泡。
Jackrong 先前开源了 Trace-Inverter-4B 与两组反演数据,其训练过程使用了 Claude 推理气泡作为监督。本文作者换了一条路径:直接使用 Jackrong 反演出的 trace 作为训练数据,气泡被完全剔除,对 Qwen3-4B 进行全新微调,得到 NoBubble 版本。
训练设置
- 基座模型:Qwen3-4B
- 训练方式:LoRA,BF16 精度,单卡 RTX 4090 Laptop(16GB)训练一个 epoch
- 训练数据:去重后 13,428 条样本,训练使用 12,094 条
- 输出形态:合并 LoRA 为独立 checkpoint,可直接加载
作者明确表示,这是一次「小实验」,全部流程在消费级 GPU 上即可完成。
评测结果
评测仅在 10 条确定性 held-out 样本上进行,作者强调绝对数值不具决定性,但相对趋势可参考。
| 模型 | 是否含气泡 | Token F1 | ROUGE-L |
|---|---|---|---|
| Qwen3-4B 基座 | 否 | 0.4059 | 0.2081 |
| Trace-Inverter-4B(教师) | 是 | 0.6821 | 0.4276 |
| Trace-Inverter-4B(OOD 去气泡) | 否 | 0.6061 | 0.3710 |
| Trace-Inverter-4B-NoBubble(本文) | 否 | 0.6500 | 0.3916 |
新模型在无气泡条件下,F1 与 ROUGE-L 均高于同模型 OOD 去气泡版本,并逼近带气泡教师。作者给出的「Gettier 问题」定性样例显示,NoBubble 版本同样能生成结构化、分步骤的推理骨架。
局限与作者动机
作者同时披露,Jackrong 的原始 checkpoint 在 chat template 上存在非预期行为,会将 <think> 内容放入 tool call。本次评测对加载与生成路径做了修补,但未改动任何模型权重,修补细节已在仓库中记录以便复现。
模型与代码地址:https://huggingface.co/amkkk/Trace-Inverter-4B-NoBubble
作者透露,该实验源于实际生产需求:其公司某高流量任务只记录最终答案与用户查询,传统微调因缺乏推理痕迹而效果不稳定,无气泡 trace 蒸馏正好补齐这一空缺,可用于替换现有前沿模型承担该任务。
