桃子桃子快讯
返回首页
开源

个人开发者基于 Nanbeige 三循环架构训练 Qwen3.5-9B 实验

Reddit 用户借鉴南理工 Nanbeige 4.5 的「中间层三循环」思路,在 Qwen3.5-9B 上蒸馏 Qwe…

2026.08.23 · 周日3 分钟阅读

一名 Reddit 用户 u/Important-Farmer-846 在 r/LocalLLaMA 板块发布了一组基于南理工(Nanbeige)团队「中间层循环」思路的实验。该实验以 Qwen3.5-9B 为底座,在中间层引入 Nanbeige 4.5 风格的「三循环」(triple-loop)结构,并通过蒸馏 Qwen3.8-27B 的 logits 在自建的 agentic / reasoning 数据集上进行有监督训练。作者把第一阶段权重公开在 Hugging Face,仓库名为 Lordnyx/qwen3.5-9b-triple-loop-fase1。

实验背景与方法

作者最初对 Nanbeige 系列模型在同尺寸下表现突出感到好奇,并在 0.6B 模型上验证过 Nanbeige 4.2 的双循环设计。其后从 Nanbeige 团队后续论文中读到 4.5 架构升级为「三循环」,便将同样的思路搬到 9B 规模上。

训练过程几个关键选择:

  • 中间层循环结构本身保持「全 softmax attention」,而非 DeltaNet;早期 DeltaNet 实验因小 hidden size 导致关键细节丢失、模型倾向于「幻觉」而被放弃。
  • 循环层使用独立的、更低的学习率,避免原训练设置抑制循环贡献。
  • 使用 Modal 平台 $30 免费 GPU 额度训练,因此总时长受 wall-clock 限制:最终完成约 15M tokens、1,129 个 step,未跑完完整计划。

训练曲线

作者按阶段统计了 KL 散度的均值与标准差:

  • step ~10–370:KL 均值 0.572,标准差 0.176
  • step ~380–750:KL 均值 0.648,标准差 0.197
  • step ~760–1120:KL 均值 0.650,标准差 0.227

整段训练的 KL 与 step 斜率约为 +0.000075,基本为零。作者据此判断模型在「前三段」获得了真实提升,随后进入震荡平台——并非循环结构触达能力上限,而是缺少 cosine LR decay,全程学习率保持不变。

与基线的私测对比

作者在未跑完训练的情况下对比三循环版与 Qwen3.5-9B 基线,私测结果如下:

  • 数学:+20%
  • 长上下文任务:+14%
  • 指令遵循:+20%
  • 同义改写问题下的稳定性:+62%
  • 推理:-10%
  • 翻译:-15%
  • 代码:-2%

作者强调这是私有评测,尚未验证收益是否能迁移到公开基准。推理能力下滑被定位为两类具体失败:一是跳过逐步推理导致简单算术错误,二是进入重复循环耗尽生成长度。

局限与后续

作者明确表示该模型「无法被推荐使用」——它是一个概念验证,而非可发布模型。配套的 cosine LR decay 已写入代码,若下月再次获得 Modal 免费额度,将续训完成剩余 step。就当下结论而言,实验至少证明 Nanbeige 4.5 的循环设计在 9B 这一高于其原报告的参数量上依然可以收敛,且在合适的 LR 配置下循环会迅速开始实质性参与推理过程。

信源