TUPOI:用辛动力学替代注意力的 O(1) 显存新架构
NARE LABS 发布无注意力 LLM 架构 TUPOI,以辛相空间积分取代 Attention,推理状态恒定 6 K…
独立研究团队 NARE LABS(项目自述为 15 岁开发者主导)近日在 GitHub 与 arXiv 发布了一套名为 TUPOI 的语言模型架构。该方案彻底弃用 Attention 机制与持续增长的 KV 缓存,改用 Symplectic Hamiltonian Integrator(Velocity-Verlet)在相空间 (q, p) 中演化序列表征,实现严格 O(1) 的推理状态(实测仅 6 KB),并在小规模 TinyStories 训练中以更少参数击败同条件下的 Transformer 基线。
核心思路:用动力学替代注意力
TUPOI 的核心创新在于将序列上下文建模为在辛相空间 (q, p) 中运动的粒子,通过 24 层 Velocity-Verlet Leapfrog 积分方案递推隐状态。离散化更新规则为:先用势函数梯度更新一半动量,再用更新后的动量推进位置,最后再更新一次动量。由于该变换的雅可比行列式恒等于 1(满足刘维尔定理),相空间体积在任意序列深度上严格守恒,正向传播过程中「信息既不产生也不消失」。由此,模型完全消除了 O(N²) 的成对注意力计算和不断累积的 KV 缓存。
关键辅助模块
为稳定长序列上的语言表征,作者引入两个辅助机制:
- IgnoranceGate:可学习 sigmoid 门控 σ(W_g x),在扰动相空间前对 token 噪声做平滑过滤。
- OpinionAnchor:指数移动平均 a_t = (1-η)a_{t-1} + η·x̄',充当相空间中的「吸引子」,抑制无限生成中的状态漂移。
实验结果
在 TinyStories 数据集(约 3 亿参数规模)上,作者使用相同随机种子、优化器、token 预算与参数量级,与 GPT 风格 Transformer(BaselineLM)做了严格对比:
- TUPOI-300M(3.04 亿参数)以 3.8371 的验证集 loss 击败 3.55 亿参数的 Transformer 基线(loss 3.9280),参数少约 14%,困惑度 46.39 vs 50.80。
- 17M 与 47M 小模型同样收敛稳定,幂律拟合未出现容量饱和迹象。
在自回归逐 token 生成的状态显存测试中,TUPOI 的相空间状态始终保持 6 KB 不变:
- 512 token:Transformer KV 缓存 48 MB,TUPOI 6 KB(轻 8 000×)
- 2 048 token:192 MB vs 6 KB(轻 32 000×)
- 8 192 token:768 MB vs 6 KB(轻 128 000×)
- 32 768 token:3 GB vs 6 KB(轻 500 000×)
- 65 536 token:Transformer 6 GB 直接 CUDA OOM,TUPOI 仍为 6 KB(轻约 1 000 000×)
在 Tesla T4(FP16)上,TUPOI-300M 的峰值显存较基线 Transformer 减少约 20–25%,8K 上下文下总激活仅比静态权重基线多约 500 MB。
现存局限
作者在 README 中坦承当前验证仍非常早期:
- 300M 模型仅在最长 8K 硬件上下文下完成验证,>128K 需专用 Flash-Verlet CUDA kernel。
- GSM8k、MetaMathQA 等推理基准的监督微调仍在进行中。
- 尚未在 10 亿以上参数规模验证幂律行为是否成立。
开源与许可
项目以 MIT 协议开源,提供参考实现、预训练权重与基准复现脚本;论文以 arXiv 预印本形式发布。由于验证仍停留在 300M 规模与单一数据集阶段,TUPOI 目前更接近一份探索性研究提案,而非可投产的替代方案,其架构思路与「恒定状态」特性值得关注,但规模化与下游任务表现尚需独立复现。
