桃子桃子快讯
返回首页
研究论文

书生 InternLM 提出 Mobius 架构:解耦知识与推理,训练数据减半、推理提速近 4 倍

InternLM 发布论文与权重,提出将 FFN 知识库与 Self-Attn 推理器解耦的 Mobius-v0 架构,…

2026.08.17 · 周一3 分钟阅读

书生 InternLM 团队近日在 arXiv 发表论文,公开了名为 Mobius-v0 的新型基础模型架构,并同步释出基于该架构的 Intern-S2-Mobius 模型权重与代码。该研究的核心思路是将大模型内部的「知识存储」与「推理运算」解耦:知识以向量形式集中存放在全局共享的 FFN(Memory)中,多个 Self-Attn 模块(Reasoners)则专门负责组合式推理。两者之间通过隐藏状态作为缓存与载体,反复互相读写,从而实现更高效的知识压缩与推理。

核心架构:知识与推理的解耦设计

传统 Transformer 中,FFN 负责「记忆」、Self-Attn 负责「关联」,但两者耦合在同一层里,知识与推理相互纠缠。Mobius-v0 把这两类功能显式拆分:

  • 全局共享 Memory(FFN):统一存储知识向量,避免在每一层重复保存知识参数。
  • 多个 Reasoners(Self-Attn):在不同迭代步中向 Memory 查询所需知识向量,再把推理结果写回隐藏状态。
  • 隐藏状态既充当缓存,又充当知识在 Memory 与 Reasoner 之间流动的载体。

这种「知识-推理分离」的设计,使得模型可以用更少的参数承载更多知识,同时让推理路径更清晰、更高效。

实验结果:训练数据更省、推理更快

论文给出两项关键实验数据:

  • 从零训练的 7B 模型:下游任务得分与 7B Transformer 基线相当,但只使用了基线 62.6% 的训练数据量,说明知识压缩效率显著提升。
  • 从 Qwen3.5-35B 持续预训练得到的 Intern-S2-Mobius:下游任务得分与同源基线相当的情况下,端到端推理速度提升接近 4 倍

第二个结果对实际部署尤为关键:在不牺牲效果的前提下,推理时延显著下降,意味着该架构在工业落地中具备直接的成本优势。

开源与可用资源

研究团队同步放出了完整资源,方便社区复现与进一步研究:

整体来看,Mobius-v0 提出了一条不同于纯 Scaling 的优化路线——通过结构层面的解耦来同时压训练成本与推理成本。如果后续在更大规模、更长上下文的任务上得到验证,这类「知识-推理分离」设计有望成为下一代高效基础模型的备选架构之一。

信源