桃子桃子快讯
←返回首页
研究论文

Reddit 用户提出新优化器 Tauon,称在极小模型上优于 Muon

Reddit 用户发布自研优化器 Tauon,用多项式正交化思路改造 Muon,在 GPT-Mini 上取得更低损失与更…

2026.09.27 · 周日约 2 分钟阅读

一名开发者在 Reddit 的 r/MachineLearning 板块发布了一款名为 Tauon 的新型神经网络优化器。作者声称,Tauon 在沿用 Muon 多项式正交化思路的基础上,通过谱滤波把正交化步骤压缩到 3 步、再借助系数调度降至 2 步,并结合 DCT-2 降低参与正交化的矩阵规模,从而在保持效果的同时减少了计算开销。代码已在 GitHub 开源,并发布到 PyPI(pip install tauon-optimizer)。

实验设置与结果

由于硬件条件有限,作者仅在 Kaggle 免费的 T4 GPU 上跑了 3000 步,对照对象是同样基于正交化的 Muon,以及最常用的 AdamW。

  • 模型:GPT-Mini,d_model = 512,共 6 层
  • 数据集:TinyShakespeare
  • 学习率:Tauon 与 Muon 均为 0.02,AdamW 为 0.0006

三者在同一硬件下的关键指标如下:

  • 验证损失:Tauon 收敛到约 1.6,低于 Muon 的约 1.65 和 AdamW 的约 1.8
  • 训练稳定性:AdamW 在约 1200 步后出现过拟合/发散迹象,Tauon 在 3000 步内保持稳定
  • 步耗时:Tauon 为 391.5 ms/步,Muon 为 427.7 ms/步,约快 8.5%,接近 AdamW 的 382.9 ms/步

局限性与社区反馈邀请

作者本人在帖子里坦承,这只是「非常迷你的基准」,受限于 Kaggle 剩余时长,没有条件在更大模型或更大数据集上验证。Tauon 的名字撞名已有 Python 包「teon」,作者也公开征求更好的命名建议。帖子最后请求社区在更大规模训练中复现,并欢迎提出改进意见。

整体来看,Tauon 是基于 Muon 的工程改进尝试,在原理上有清晰的改造点(谱滤波 + 系数调度 + DCT-2 缩矩阵),但要判断其是否真正具备实用性,仍需在更大规模模型和标准基准(如 GPT-2/7B 级别训练)上做系统性对比。

信源