桃子桃子快讯
返回首页
研究论文

TUPOI:用辛动力学替代注意力的 O(1) 显存新架构

NARE LABS 发布无注意力 LLM 架构 TUPOI,以辛相空间积分取代 Attention,推理状态恒定 6 K…

2026.08.16 · 周日4 分钟阅读

独立研究团队 NARE LABS(项目自述为 15 岁开发者主导)近日在 GitHub 与 arXiv 发布了一套名为 TUPOI 的语言模型架构。该方案彻底弃用 Attention 机制与持续增长的 KV 缓存,改用 Symplectic Hamiltonian Integrator(Velocity-Verlet)在相空间 (q, p) 中演化序列表征,实现严格 O(1) 的推理状态(实测仅 6 KB),并在小规模 TinyStories 训练中以更少参数击败同条件下的 Transformer 基线。

核心思路:用动力学替代注意力

TUPOI 的核心创新在于将序列上下文建模为在辛相空间 (q, p) 中运动的粒子,通过 24 层 Velocity-Verlet Leapfrog 积分方案递推隐状态。离散化更新规则为:先用势函数梯度更新一半动量,再用更新后的动量推进位置,最后再更新一次动量。由于该变换的雅可比行列式恒等于 1(满足刘维尔定理),相空间体积在任意序列深度上严格守恒,正向传播过程中「信息既不产生也不消失」。由此,模型完全消除了 O(N²) 的成对注意力计算和不断累积的 KV 缓存。

关键辅助模块

为稳定长序列上的语言表征,作者引入两个辅助机制:

  • IgnoranceGate:可学习 sigmoid 门控 σ(W_g x),在扰动相空间前对 token 噪声做平滑过滤。
  • OpinionAnchor:指数移动平均 a_t = (1-η)a_{t-1} + η·x̄',充当相空间中的「吸引子」,抑制无限生成中的状态漂移。

实验结果

在 TinyStories 数据集(约 3 亿参数规模)上,作者使用相同随机种子、优化器、token 预算与参数量级,与 GPT 风格 Transformer(BaselineLM)做了严格对比:

  • TUPOI-300M(3.04 亿参数)以 3.8371 的验证集 loss 击败 3.55 亿参数的 Transformer 基线(loss 3.9280),参数少约 14%,困惑度 46.39 vs 50.80。
  • 17M 与 47M 小模型同样收敛稳定,幂律拟合未出现容量饱和迹象。

在自回归逐 token 生成的状态显存测试中,TUPOI 的相空间状态始终保持 6 KB 不变:

  • 512 token:Transformer KV 缓存 48 MB,TUPOI 6 KB(轻 8 000×)
  • 2 048 token:192 MB vs 6 KB(轻 32 000×)
  • 8 192 token:768 MB vs 6 KB(轻 128 000×)
  • 32 768 token:3 GB vs 6 KB(轻 500 000×)
  • 65 536 token:Transformer 6 GB 直接 CUDA OOM,TUPOI 仍为 6 KB(轻约 1 000 000×)

在 Tesla T4(FP16)上,TUPOI-300M 的峰值显存较基线 Transformer 减少约 20–25%,8K 上下文下总激活仅比静态权重基线多约 500 MB。

现存局限

作者在 README 中坦承当前验证仍非常早期:

  • 300M 模型仅在最长 8K 硬件上下文下完成验证,>128K 需专用 Flash-Verlet CUDA kernel。
  • GSM8k、MetaMathQA 等推理基准的监督微调仍在进行中。
  • 尚未在 10 亿以上参数规模验证幂律行为是否成立。

开源与许可

项目以 MIT 协议开源,提供参考实现、预训练权重与基准复现脚本;论文以 arXiv 预印本形式发布。由于验证仍停留在 300M 规模与单一数据集阶段,TUPOI 目前更接近一份探索性研究提案,而非可投产的替代方案,其架构思路与「恒定状态」特性值得关注,但规模化与下游任务表现尚需独立复现。

信源