桃子桃子快讯
返回首页
开源

DWARF-55M-Base:基于 DSQG 稀疏注意力的研究原型开源

研究者发布 DWARF 架构首个 55M 基础模型,主打近乎全稀疏的 DSQG 注意力,长上下文推理带宽接近 O(1)。

2026.07.21 · 周二3 分钟阅读

一位独立研究者在 Reddit r/LocalLLaMA 发布了 DWARF 架构的首个基础模型 DWARF-55M-Base。这是一个面向稀疏注意力研究的小型原型,参数量仅 55M,训练数据为 10B tokens 的 Dolma3 Mix 150B,采用了基于 OLMo1 Base 修改的 ChatML 分词器(词表大小 50282)。模型权重已上传 HuggingFace,实验代码开放在 GitHub,供社区自行验证。

核心架构:DSQG 稀疏注意力

DWARF 的核心是 Dynamic Sparse Query-Gather(DSQG)层。传统全注意力需要让每个 token 与所有历史 token 交互,计算和显存开销随上下文长度线性增长;而 DSQG 用一组固定的、具备因果性的近距与远距 token 偏移来替代全注意力,每个 token 只查询过去中一个小型、多尺度的子集,再通过 query/key 探针信号学习「哪些采样位置重要」,并调制其值。

在架构层面,DWARF 以 9 层 DSQG 作为主干传输层,再在 25% 层深度位置插入 1 层完整的因果注意力作为「全局混合器」。以 32 层模型为例,仅需在第 7 层放置一层全注意力,即可实现对训练上下文长度 2048 的稳定检索。

长上下文与 KV 缓存特性

由于 DSQG 在解码每个新 token 时只读取固定数量的偏移,而非扫描全部历史,其每 token 的 KV-cache 带宽与注意力计算量随上下文长度「近乎为 O(1)」。这意味着在长上下文推理场景下,理论上能显著降低显存压力与推理成本。

作者还提到一个尚未充分验证的初步观察:在仅以 N=2048 训练时,模型在 3 倍训练长度(N=6144)处仍能保持相对稳定的检索能力,但作者强调「这还需要更严格的测试确认」。

现状与局限

需要指出的是:

  • 模型仅有 55M 参数,属于研究原型,并非面向生产的模型;
  • 发布渠道为 Reddit 个人帖子,没有配套论文,也未公开与主流模型的标准 benchmark 对比数据;
  • 训练规模仅 10B tokens,能力上限有限;
  • GitHub 中提供了 HISA 路径作为实验选项,可在 L3 层替换全注意力以获得与混合架构相近的性能,但作者明确该路径「仍在实验阶段,尚未完全敲定」。

整体来看,DWARF-55M-Base 是一次对稀疏注意力 + 长上下文推理成本问题的早期探索,技术思路值得关注,但成熟度与影响力均较为有限。

信源