超越 Transformer:下一代大模型架构的四条新路径
MIT Technology Review 报道,Transformer 的算力与上下文瓶颈正催生新一波架构创新,多家初…
自 2017 年 Google 研究团队发表「Attention Is All You Need」以来,Transformer 已成为几乎所有主流大语言模型的核心引擎。但 MIT Technology Review 近期的一篇深度报道指出,这一架构正开始显现疲态:推理模型的兴起、超长上下文的需求以及急剧膨胀的算力成本,正在把 Transformer 推到瓶颈位置。一批初创公司正押注「Transformer 之后」的下一代架构,押注的方式从稀疏注意力到状态保持机制,各有侧重。
Transformer 的两大天花板
Transformer 的核心机制是「密集注意力」:它会对文本中的每个词(或子词 token)与所有其他词进行两两比较,从而编码语义。这种方式精度极高,但计算量随文本长度呈平方级增长。MIT Technology Review 给出的例子是:一篇 1 万词的文档,可能需要模型执行 5000 万次乘法运算。这正是大模型耗电量惊人的根源之一。
OpenAI 总裁 Greg Brockman 透露,公司今年算力支出预计高达 500 亿美元;国际能源署(IEA)则预测,到 2030 年全球数据中心耗电量将翻倍。
更关键的是,Transformer 的「逐词处理」机制并不擅长一次性承载海量信息——也就是业内所说的「上下文窗口」存在天然上限。但要让大模型完成更复杂的任务(如分析整个代码库、处理智能体间的大量交互),就必须打破上下文瓶颈。推理模型同样依赖「思维链」式的自我笔记展开,这进一步推高了上下文压力。换言之,Transformer 曾经的杀手锏,如今正变成它的限制。
新路径一:用稀疏注意力减少计算
最直接的改进思路是改写注意力本身。稀疏注意力(sparse attention)只对文本中部分词对进行计算,可大幅压缩算力开销。问题在于,过去提出的多种稀疏注意力机制在语义捕捉能力上都不及密集注意力。
总部位于迈阿密的初创公司 Subquadratic 声称已突破这一瓶颈。该公司 CEO 兼联合创始人 Justin Dangel 表示,他们发明了首个在搜索、编码等任务上可比肩主流大模型的稀疏注意力机制。其模型 SubQ 的工作方式是:对每一段输入文本动态判断哪些词重要、哪些可以忽略。该公司还透露,已有数千人加入候补名单,并计划尽快开放模型。
不过行业对这一说法仍持怀疑态度,毕竟「比肩主流大模型」是相当大胆的声明。
新路径二:用状态保留替换注意力
另一家总部位于旧金山的初创公司 Manifest AI 选择了更激进的方向——直接用一种新机制替代注意力本身。这套机制被称为「Power Retention」(功率保留),其核心思路是:模型不再保留上下文窗口中的全部信息,而是维护一份「滚动摘要」,新信息进入时自动淘汰相关性较低的内容。
「保留」思想本身已有约十年历史,但 Manifest AI 声称首次将其工程化到可与 Transformer 模型正面竞争的水平。该公司还展示了两个落地案例:
- 把开源编程大模型 StarCoder 改造为采用 Power Retention 的 PowerCoder;
- 发布新模型 Brumby,公司称其在部分任务上可媲美阿里 Qwen 系列的部分版本。
更值得注意的是,Manifest AI 表示只需少量重新训练,就能把现有 Transformer 模型改造为 Power Retention 模型,这对存量生态的迁移非常关键。
行业意义与不确定性
MIT Technology Review 将这一代试图走出 Transformer 阴影的新架构统称为「LLMs+」,并将其列入今年「AI 领域十件大事」名单。文章明确指出,大模型本身不会被取代,变化的将是「如何构建大模型」。
对 Subquadratic、Manifest AI 等初创公司而言,机会巨大,但风险同样不小。它们既没有头部厂商的算力与数据沉淀,也没有现成的产品矩阵。但也正因为此,它们的试错空间反而更大——若稀疏注意力或状态保留机制被验证可行,LLM 行业的算力曲线与上下文天花板都将被重新定义。
