学者提「持续状态机」架构 称 LLM 注意力推理较 RTX 3090 提速逾 2000 倍
独立研究者发布预印本,提出持续状态机计算范式与 ASMA 硅基架构,声称可打破冯·诺依曼内存墙,实现极长上下文场景下的千…
一篇于 2026 年 7 月发布在 TechRxiv 的预印本论文提出「持续状态机」(Persistent State Machine,下称 PSM)这一新型计算范式,并基于此设计了面向 LLM KV-cache 注意力计算的硅基参考架构 ASMA。作者声称,该方案可在极长上下文场景下较 NVIDIA GeForce RTX 3090 GPU 取得逾两千倍的物理加速,能耗与总线流量下降均接近两个数量级。该论文目前已申请日本专利(申请号 2026-177318),尚处于审查阶段。
核心思路:从「搬运数据」到「广播指令」
论文指出,冯·诺依曼架构下的内存墙——即计算单元与存储之间的带宽与能耗鸿沟——已成为 LLM 推理的主要瓶颈。PSM 的设计思路与 PIM(Processing-in-Memory)类研究有相通之处:将计算作为指令广播到静止的内存单元,由各单元在本地完成状态转移评估,而非反复搬运数据。该范式被形式化为一个六元组,作者证明其包含确定性有限自动机(DFA),并在物理内存约束 L ≤ N 下与线性有界自动机(LBA)等价,具备 PSPACE 完整的表达能力。
ASMA 架构与性能声称
基于 PSM 范式,作者给出了可综合的硅基参考实现 ASMA(Active State-machine Memory Architecture),目标负载是 LLM 推理中的 KV-cache 注意力计算。论文给出的关键性能数据如下:
- 系统总线流量较 GPU 基线下降 99.47%
- 每步净能耗下降 99.44%
- 在 B=32、N=131k 的极长上下文多批次解码场景下,相对 RTX 3090 实现 2,129.19 倍物理加速
若这些数字在独立实验中可被复现,将意味着 LLM 长上下文推理的能耗与吞吐瓶颈有可能从 GPU 转移到专用近数据计算芯片。
来源与可信度提示
需注意的是,该论文作者署名为「Cosmos Administrative Scrivener Office & Independent Researcher」,即一家日本文书代书事务所与独立研究者联合署名,并非已知的芯片或大模型研究机构;上传渠道为非同行评审的预印本平台 TechRxiv,正文 PDF 仅 23 KB;论文给出的两千倍加速属于非常极端的声明,目前缺乏第三方复现或独立基准支撑。读者宜将其视为一条值得跟踪的思路,而非已经验证的事实——尤其是软硬件栈成熟度、与现有 CUDA/Triton 生态的兼容性、实际良率与可制造性等关键问题,文中均未展开讨论。
