研究论文
Reddit 用户提出新优化器 Tauon,称在极小模型上优于 Muon
Reddit 用户发布自研优化器 Tauon,用多项式正交化思路改造 Muon,在 GPT-Mini 上取得更低损失与更…
2026.09.27 · 周日约 2 分钟阅读
一名开发者在 Reddit 的 r/MachineLearning 板块发布了一款名为 Tauon 的新型神经网络优化器。作者声称,Tauon 在沿用 Muon 多项式正交化思路的基础上,通过谱滤波把正交化步骤压缩到 3 步、再借助系数调度降至 2 步,并结合 DCT-2 降低参与正交化的矩阵规模,从而在保持效果的同时减少了计算开销。代码已在 GitHub 开源,并发布到 PyPI(pip install tauon-optimizer)。
实验设置与结果
由于硬件条件有限,作者仅在 Kaggle 免费的 T4 GPU 上跑了 3000 步,对照对象是同样基于正交化的 Muon,以及最常用的 AdamW。
- 模型:GPT-Mini,d_model = 512,共 6 层
- 数据集:TinyShakespeare
- 学习率:Tauon 与 Muon 均为 0.02,AdamW 为 0.0006
三者在同一硬件下的关键指标如下:
- 验证损失:Tauon 收敛到约 1.6,低于 Muon 的约 1.65 和 AdamW 的约 1.8
- 训练稳定性:AdamW 在约 1200 步后出现过拟合/发散迹象,Tauon 在 3000 步内保持稳定
- 步耗时:Tauon 为 391.5 ms/步,Muon 为 427.7 ms/步,约快 8.5%,接近 AdamW 的 382.9 ms/步
局限性与社区反馈邀请
作者本人在帖子里坦承,这只是「非常迷你的基准」,受限于 Kaggle 剩余时长,没有条件在更大模型或更大数据集上验证。Tauon 的名字撞名已有 Python 包「teon」,作者也公开征求更好的命名建议。帖子最后请求社区在更大规模训练中复现,并欢迎提出改进意见。
整体来看,Tauon 是基于 Muon 的工程改进尝试,在原理上有清晰的改造点(谱滤波 + 系数调度 + DCT-2 缩矩阵),但要判断其是否真正具备实用性,仍需在更大规模模型和标准基准(如 GPT-2/7B 级别训练)上做系统性对比。
