HyperSAE:基于双曲几何的 LLM 可解释性引擎开源
开发者发布开源工具 HyperSAE,在稀疏自编码器中引入双曲几何权重正则化,在 Gemma-2-2B 上较平坦 SAE…
面向大语言模型机理可解释性的开源工具 HyperSAE 近日在 Hacker News 发布。该项目将双曲几何(Poincaré 流形)权重正则化引入稀疏自编码器(Sparse Autoencoder, SAE),在保留标准 SAE 推理速度的同时,尝试提取更接近真实语义层级结构的概念本体。
核心思路:快慢路径解耦
HyperSAE 的关键设计是把计算拆成两条路径:
- Fast-Path(欧氏前向传播):活跃的 token 数据全程在 $\mathbb{R}^d$ 欧氏空间内计算,保留 bf16 推理效率,兼容基模型的 RMSNorm 等归一化层,并可直接接入因果干预(causal steering)流程。
- Slow-Path(双曲权重正则化):解码器权重 $W_{dec}$ 和深度标量 $r_i$ 在优化时被映射到 Poincaré 球 $(\mathcal{B}^d, g_x)$ 上,借助 Asymmetric Poincaré Entailment Loss 强制概念之间的层级关系。
两条路径通过双优化器(AdamW / RiemannianAdam)协同更新,从而在不动前向计算的前提下,为参数空间引入黎曼负曲率的结构约束。
基准测试结果
作者在 Gemma-2-2B 第 13 层残差流激活($d=2304$,字典大小 $M=16384$)上,使用 FineWeb-Edu 上 2000 万 token 流式训练,并在 NVIDIA L4 GPU 集群上做了对比:
- 下游推理能力保留:GPQA Diamond 上基模型准确率 66.67%,FlatSAE 与 HyperSAE 均能保持 100% 相对能力;MMLU-Pro(12,032 题)上基模型 17.69%,FlatSAE 16.11%,HyperSAE 16.26%,即在单 token 替换后 HyperSAE 仍比 FlatSAE 高 0.15 个百分点。
- 重建–稀疏性 Pareto 表现:在 $L_1=0.005$、$L_0 \approx 53$ 的匹配稀疏度下,HyperSAE 重建 MSE 由 4.5724 降至 4.1232(降低约 9.8%),Cross-Entropy Loss Recovery 由 75.5% 提升至 78.9%(+3.4 个百分点)。
- 高稀疏度区间:$L_1=0.0005$、$L_0 \approx 2300$ 时,HyperSAE 重建 MSE 进一步降至 0.7666,CE 恢复率 98.1%,均优于 FlatSAE 对照。
软件架构与使用
项目以 PyPI 包形式发布,可通过 pip install hypersae 直接安装,或从 GitHub 源码构建。主要模块包括:
HyperSAE:核心模型,封装线性前向与可学习径向深度 $r_i \in [0,1)$。FlatSAE:标准欧氏基线,用于对照实验。TriPartiteLoss:组合 MSE 重建、$L_1$ 稀疏与 Poincaré 锥蕴含惩罚的损失函数。CoActivationQueue:异步 GPU 队列,跟踪特征共现但不产生 $\mathcal{O}(M^2)$ 的内存增长。hooks:兼容 PyTorch 与 TransformerLens 的前向 hook 工具,便于做 steering 与干预。
最小示例只需数行代码即可实例化模型、队列、损失与训练器,在 cuda 设备上完成一次 train_step,输出总损失、重建 MSE 与 Poincaré Entailment 惩罚三项指标。
研究论文与许可
项目同时附有两篇论文,分别从理论层面(Weight-Space Regularization and Hyperbolic Geometry in Mechanistic Interpretability)与实证层面(Hyperbolic SAE 在 LLM 激活上的 Poincaré 流形验证)展开论述。代码遵循 MIT 协议开源。
对于从事机理可解释性研究的团队而言,HyperSAE 提供了一条在保留 SAE 可扩展性的同时引入层级结构先验的可复现路径;但项目目前仍由个人开发者维护,结论的鲁棒性尚需更多独立复现。
