桃子桃子快讯
返回首页
研究论文

对称性能否解释权重空间感知的塌缩

作者用约 180 万个 SIREN 隐式神经表示拟合,区分对称性的充分性与中介性,发现仅打散对称群即可重现绝大部分共享初…

2026.08.20 · 周四4 分钟阅读

一位独立研究者在 Reddit r/MachineLearning 发布论文,通过对约 180 万个 SIREN 隐式神经表示(INR)进行拟合实验,试图精确回答一个长期被混在一起的问题——为什么共享初始化的神经网络权重能直接「读出」语义,而独立训练的权重却几乎完全失效?这项工作把「参数对称性」这一常见解释拆成三条独立可检验的命题,并给出相应的理论刻画与实证数据。

研究背景:权重空间学习中的「初始化困境」

用神经网络权重直接预测其行为或语义的 weight-space learning 近年成为一个活跃方向。一个反复出现的现象是:当所有网络共享同一初始化、仅在数据或任务上分化时,下游模型能从权重中学到很多信息;一旦网络各自独立拟合,性能便大幅下降。社区普遍把责任归于参数对称性——神经元置换、符号翻转等变换会改变权重向量的外观,却不改变所表示的函数。这一解释实际混合了三层不同主张:

  • 参数化本身存在一个对称群;
  • 把该对称群纳入考虑后,权重空间预测能力会提升;
  • 该对称性足以解释共享初始化与独立初始化之间的性能落差。

三者并不等价,需要分别测量。

理论刻画:单层与双层情形

研究聚焦 SIREN 风格的隐式神经表示,其隐藏神经元使用正弦激活。对于一个隐藏层正弦神经元,函数保持变换生成的群是无穷二面体群 D∞,加上神经元置换后形成 D∞ wr S_n。作者利用实现函数的分布 Fourier 变换证明:在一般性条件下,参数可在该群作用下唯一恢复——Fourier 变换成为支撑在 ±w_i 的原子测据,将参数识别问题严格归约到对称群轨道。

值得注意的是,这一对称群并不只包含传统意义上的置换与符号翻转。整数 π 的相位变换是仿射而非线性的,无法被仅作用于单项式矩阵的对称描述覆盖。深度为二时情况更复杂,因为一个神经元的输出权重同时被下一层作用。作者改用第二层 Gram 矩阵耦合两层,构造出精确的跨层不变量,避免逐神经元独立处理带来的误差。

实验:180 万拟合的关键结果

实证部分在 MNIST、FashionMNIST、CIFAR-10 上拟合约 180 万个 INR,协议上区分共享初始化、优化随机性与完全独立初始化三种情形。最关键的发现是:

  • 仅对精确对称群进行随机化(同时保持网络所表示的函数不变),可摧毁 MNIST 上共享初始化与随机初始化之间 80.4 准确率差距中的 79.1 分;
  • 在被诱导的损失中,符号翻转贡献约 63 分,神经元重标记约 15 分,整数 π 相位移约 1 分;
  • 一个直接在原始参数上做 D∞ wr S_n 商化的读出器达到 0.917 准确率,显著优于轨道重表达(0.628)、固定不变量编码(0.526)与置换等变基线(0.265)。

作者同时强调:上述结果说明的是「充分性」(sufficiency),即对称散射本身足以重现几乎全部性能下降,并不等同于说明自然发生的差距中有 79.1/80.4 由对称性因果中介——这两个估计量并不等价。

概念问题:信息 vs. 计算

把权重空间推理与「直接把 INR 当函数查询」做 FLOPs 匹配对比时,函数空间路线仍占明显优势:使用 64 个学习到的查询坐标,仅需 1.6 MFLOP 即可达到 95.3% 准确率;而权重空间路线的最优前沿是 5.5 MFLOP 取得 64.4%。这引出本文最值得讨论的概念性问题——若完整不变量在信息论上等价于函数本身,那么「直接在权重空间操作」的最强理由最终可能只能是计算性的,而非信息性的。

开源材料与开放问题

论文、实现、测试、预注册、实验记录、预测与结论账本均已开源:https://github.com/ITheClixs/project-siren-gap 。作者邀请同行对三处具体问题提出批评:充分性与中介性的区分是否严格;单层极限定理是否存在反例或遗漏假设;关于周期激活网络仿射对称群的相关工作是否完整。

信源