桃子桃子快讯
返回首页
工具

HyperSAE:基于双曲几何的 LLM 可解释性引擎开源

开发者发布开源工具 HyperSAE,在稀疏自编码器中引入双曲几何权重正则化,在 Gemma-2-2B 上较平坦 SAE…

2026.08.12 · 周三5 分钟阅读

面向大语言模型机理可解释性的开源工具 HyperSAE 近日在 Hacker News 发布。该项目将双曲几何(Poincaré 流形)权重正则化引入稀疏自编码器(Sparse Autoencoder, SAE),在保留标准 SAE 推理速度的同时,尝试提取更接近真实语义层级结构的概念本体。

核心思路:快慢路径解耦

HyperSAE 的关键设计是把计算拆成两条路径:

  • Fast-Path(欧氏前向传播):活跃的 token 数据全程在 $\mathbb{R}^d$ 欧氏空间内计算,保留 bf16 推理效率,兼容基模型的 RMSNorm 等归一化层,并可直接接入因果干预(causal steering)流程。
  • Slow-Path(双曲权重正则化):解码器权重 $W_{dec}$ 和深度标量 $r_i$ 在优化时被映射到 Poincaré 球 $(\mathcal{B}^d, g_x)$ 上,借助 Asymmetric Poincaré Entailment Loss 强制概念之间的层级关系。

两条路径通过双优化器(AdamW / RiemannianAdam)协同更新,从而在不动前向计算的前提下,为参数空间引入黎曼负曲率的结构约束。

基准测试结果

作者在 Gemma-2-2B 第 13 层残差流激活($d=2304$,字典大小 $M=16384$)上,使用 FineWeb-Edu 上 2000 万 token 流式训练,并在 NVIDIA L4 GPU 集群上做了对比:

  • 下游推理能力保留:GPQA Diamond 上基模型准确率 66.67%,FlatSAE 与 HyperSAE 均能保持 100% 相对能力;MMLU-Pro(12,032 题)上基模型 17.69%,FlatSAE 16.11%,HyperSAE 16.26%,即在单 token 替换后 HyperSAE 仍比 FlatSAE 高 0.15 个百分点。
  • 重建–稀疏性 Pareto 表现:在 $L_1=0.005$、$L_0 \approx 53$ 的匹配稀疏度下,HyperSAE 重建 MSE 由 4.5724 降至 4.1232(降低约 9.8%),Cross-Entropy Loss Recovery 由 75.5% 提升至 78.9%(+3.4 个百分点)。
  • 高稀疏度区间:$L_1=0.0005$、$L_0 \approx 2300$ 时,HyperSAE 重建 MSE 进一步降至 0.7666,CE 恢复率 98.1%,均优于 FlatSAE 对照。

软件架构与使用

项目以 PyPI 包形式发布,可通过 pip install hypersae 直接安装,或从 GitHub 源码构建。主要模块包括:

  • HyperSAE:核心模型,封装线性前向与可学习径向深度 $r_i \in [0,1)$。
  • FlatSAE:标准欧氏基线,用于对照实验。
  • TriPartiteLoss:组合 MSE 重建、$L_1$ 稀疏与 Poincaré 锥蕴含惩罚的损失函数。
  • CoActivationQueue:异步 GPU 队列,跟踪特征共现但不产生 $\mathcal{O}(M^2)$ 的内存增长。
  • hooks:兼容 PyTorch 与 TransformerLens 的前向 hook 工具,便于做 steering 与干预。

最小示例只需数行代码即可实例化模型、队列、损失与训练器,在 cuda 设备上完成一次 train_step,输出总损失、重建 MSE 与 Poincaré Entailment 惩罚三项指标。

研究论文与许可

项目同时附有两篇论文,分别从理论层面(Weight-Space Regularization and Hyperbolic Geometry in Mechanistic Interpretability)与实证层面(Hyperbolic SAE 在 LLM 激活上的 Poincaré 流形验证)展开论述。代码遵循 MIT 协议开源。

对于从事机理可解释性研究的团队而言,HyperSAE 提供了一条在保留 SAE 可扩展性的同时引入层级结构先验的可复现路径;但项目目前仍由个人开发者维护,结论的鲁棒性尚需更多独立复现。

信源