研究论文
HyperSAE:引入双曲几何的稀疏自编码器方案
开发者推出 HyperSAE,在 SAE 训练中引入 Poincaré 双曲几何,在 Gemma-2-2B 上重建 MS…
2026.08.12 · 周三约 3 分钟阅读
Reddit 用户 vishalverma 在 r/MachineLearning 发布并开源了 HyperSAE:一个在稀疏自编码器(Sparse Autoencoder, SAE)中引入 Poincaré 双曲几何的 PyTorch 库,面向大语言模型的机制可解释性研究。仓库与论文均已公开,并可通过 pip install hypersae 直接安装。
动机:欧氏空间与层级结构的失配
标准 SAE 将字典原子嵌入欧氏空间,其体积随半径呈 $O(r^d)$ 增长;而 LLM 学到的概念更接近分支层级结构,体积增长接近 $O(b^r)$。当字典规模达到 16K 以上时,两种增长速率的失配会导致边界处的特征碰撞、死潜变量增多以及重建质量下降。HyperSAE 试图用双曲几何缓解这一失配。
架构:前向欧氏、训练期双曲的双速设计
HyperSAE 采用解耦的双速设计:
- 前向推理完全保留在欧氏空间,零额外推理开销,因果干预仍可表示为单次向量加法。
- 训练阶段,字典权重被投影到 Poincaré 球内,并通过「蕴含锥损失」(entailment cone loss)将父概念压向球心、子概念推向边界——这一区域的双曲体积呈指数增长,正好契合层级结构。
库内还附带共激活队列追踪、三元组损失(重建 + L1 稀疏 + 蕴含)以及单分类训练器接口,便于在已有 SAE 流程中替换使用。
实验结果:Gemma-2-2B 第 13 层 / FineWeb-Edu / NVIDIA L4
作者在 Gemma-2-2B 第 13 层、使用 2000 万 token 的 FineWeb-Edu 训练数据进行了对比:
- 重建 MSE:4.5724 → 4.1232,下降 9.8%
- CE 损失恢复率:75.5% → 78.9%,提升 3.4 个百分点
- 死潜变量比例:3.8% → 0.2%,下降 3.6 个百分点
- MMLU-Pro 准确率:16.11% → 16.26%,提升 0.15 个百分点
- GPQA Diamond:两者均为 100%,无差异
其中死潜变量的大幅减少与重建 MSE 的改善是核心亮点;下游基准的增益幅度较小,作者也并未声称会显著影响模型能力。
现状与局限
该项目由独立开发者完成,论文与代码均已发布,但目前缺少第三方复现与更大模型/更大字典规模的验证。涉及几何公式、基准设定或消融实验的反馈,作者在原帖中表示欢迎讨论。对于正在做 SAE 训练或机制可解释性实验的研究者,HyperSAE 提供了一个轻量、即插即用的替换选项。
