桃子桃子快讯
返回首页
研究论文

HyperSAE:引入双曲几何的稀疏自编码器方案

开发者推出 HyperSAE,在 SAE 训练中引入 Poincaré 双曲几何,在 Gemma-2-2B 上重建 MS…

2026.08.12 · 周三3 分钟阅读

Reddit 用户 vishalverma 在 r/MachineLearning 发布并开源了 HyperSAE:一个在稀疏自编码器(Sparse Autoencoder, SAE)中引入 Poincaré 双曲几何的 PyTorch 库,面向大语言模型的机制可解释性研究。仓库与论文均已公开,并可通过 pip install hypersae 直接安装。

动机:欧氏空间与层级结构的失配

标准 SAE 将字典原子嵌入欧氏空间,其体积随半径呈 $O(r^d)$ 增长;而 LLM 学到的概念更接近分支层级结构,体积增长接近 $O(b^r)$。当字典规模达到 16K 以上时,两种增长速率的失配会导致边界处的特征碰撞、死潜变量增多以及重建质量下降。HyperSAE 试图用双曲几何缓解这一失配。

架构:前向欧氏、训练期双曲的双速设计

HyperSAE 采用解耦的双速设计:

  • 前向推理完全保留在欧氏空间,零额外推理开销,因果干预仍可表示为单次向量加法。
  • 训练阶段,字典权重被投影到 Poincaré 球内,并通过「蕴含锥损失」(entailment cone loss)将父概念压向球心、子概念推向边界——这一区域的双曲体积呈指数增长,正好契合层级结构。

库内还附带共激活队列追踪、三元组损失(重建 + L1 稀疏 + 蕴含)以及单分类训练器接口,便于在已有 SAE 流程中替换使用。

实验结果:Gemma-2-2B 第 13 层 / FineWeb-Edu / NVIDIA L4

作者在 Gemma-2-2B 第 13 层、使用 2000 万 token 的 FineWeb-Edu 训练数据进行了对比:

  • 重建 MSE:4.5724 → 4.1232,下降 9.8%
  • CE 损失恢复率:75.5% → 78.9%,提升 3.4 个百分点
  • 死潜变量比例:3.8% → 0.2%,下降 3.6 个百分点
  • MMLU-Pro 准确率:16.11% → 16.26%,提升 0.15 个百分点
  • GPQA Diamond:两者均为 100%,无差异

其中死潜变量的大幅减少与重建 MSE 的改善是核心亮点;下游基准的增益幅度较小,作者也并未声称会显著影响模型能力。

现状与局限

该项目由独立开发者完成,论文与代码均已发布,但目前缺少第三方复现与更大模型/更大字典规模的验证。涉及几何公式、基准设定或消融实验的反馈,作者在原帖中表示欢迎讨论。对于正在做 SAE 训练或机制可解释性实验的研究者,HyperSAE 提供了一个轻量、即插即用的替换选项。

信源