LeCun 转发力挺,VISReg 破解 JEPA 表征坍塌难题
VISReg 将表征正则解耦为「尺度」与「形状」两项独立目标,在 15 个数据集上优于 7 种主流 SSL 方法,以约…
自监督学习新工作 VISReg(Variance-Invariance-Sketching Regularization)近日获得图灵奖得主 Yann LeCun 连续转发。他在转发时写道「VICReg begat SIGReg which begat VISReg」,一句话点明了 VICReg → SIGReg → VISReg 这条正则化路线的技术传承。该工作聚焦 JEPA 世界模型长期面临的「表征坍塌」难题,即模型倾向把不同输入映射到相同或极少数向量,看似完成训练,实则未学到有判别力的表征。
研究背景:从 VICReg 到 SIGReg 再到 VISReg
为抑制坍塌,主流方法多依赖启发式技巧(EMA、教师-学生网络、停止梯度、冻结层等),训练脆弱且难以调参。另一条路线是通过正则项直接约束表征分布:
- VICReg:将学习目标拆为方差、不变性、协方差三项,但协方差只刻画二阶统计量,无法区分均值方差相同而分布形状迥异的两种表征。
- SIGReg:基于 Cramér–Wold 定理,用 sketching 将整个嵌入分布对齐到标准高斯,从而约束完整分布形状。
- SIGReg 的两大缺陷:坍塌时梯度消失(修正信号最弱时恰恰最需要),且尺度与形状相互耦合,在长尾、低质量、低秩数据上适配性差。
VISReg 正是为解决这两大问题而提出。
核心方法:解耦尺度与形状
VISReg 对 VICReg 与 SIGReg 取长补短,将防止坍塌的正则项解耦为「尺度」与「形状」两个独立目标。
尺度正则
保留 VICReg 的方差项,控制每一维方差以防止幅值坍缩。其关键性质是:模型坍缩时该项梯度趋近常数,弥补 SIGReg 梯度消失的缺陷。
形状正则
先对标准差 σ 施加停止梯度做归一化,消除尺度影响;再用切片 Wasserstein 距离(SWD)将分布形状对齐到各向同性高斯。其理论依据是 Cramér–Wold 定理:两个分布相等,当且仅当它们沿单位球面上所有一维投影都相等。因此只需对一维切片做排序操作,即可刻画完整分布形状,而非仅二阶统计量。
复杂度与扩展性
- 正则部分计算复杂度为 O(NDK),对 batch、维度、切片数均为线性。
- VICReg 的协方差项随维度平方增长,VISReg 优势明显。
- K 个随机切片可分摊到多块 GPU 上:实验显示,从单卡 1024 切片改为 8 卡 × 每卡 128 切片,精度差距由约 2.4% 缩小至 0.22%。
- 核心逻辑仅约 15 行 PyTorch 代码。
实验结果
研究团队在 15 个数据集(8 个域内 + 6 个 OOD + ADE20K 稠密预测)上,将 VISReg 与 MoCoV3、DINO、iBOT、I-JEPA、MAE、data2vec 等 7 种主流 SSL 方法对比,覆盖天文、医疗、遥感、纹理、花卉等场景。
域内线性探测
在不使用任何启发式技巧的组别中:
- ViT-B/16:VISReg 达 75.7%,高于 MAE 的 75.1%。
- ViT-L/14:进一步提升至 77.0%,高于 LeJEPA 的 75.6%。
与使用技巧的 iBOT、DINO 相比,VISReg 在常规数据集略低,但在纹理数据集 DTD 上反超全部方法。
分布外泛化全面最优
在 6 个与 ImageNet 完全无关的 OOD 数据集(医疗、天文、遥感、纹理)上,VISReg 在所有方法和骨干规模上均取得最佳平均 OOD 精度:
- ViT-B/16:70.19%。
- ViT-L/14:70.63%。
- 高于 MAE 的 67.85%、MoCoV3 的 69.46%、DINO 的 69.56%、I-JEPA 的 68.55%。
数据效率:以 1/10 数据比肩 DINOv2
将 VISReg(ViT-L/14)在 ImageNet-22K(约 1400 万张)上预训练后,6 个 OOD 数据集平均精度达 72.94%,与在 10 倍规模数据 LVD-142M(1.42 亿张)上训练的 DINOv2(72.93%)基本持平。作为对照,仅用 ImageNet-1K 预训练的 VISReg 平均精度为 70.63%。
迁移微调与稠密预测
- 微调后,VISReg 在 CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10 五个数据集上均超过 DINO 与有监督预训练。
- ADE20K 线性语义分割 mIoU 为 30.16,高于 DINO(29.40)与 MAE(23.60),仅次于 MoCoV3(31.69)。
- 在 SiT-B/2 生成引导(iREPA 框架,10 万步)上,VISReg 在 gFID(40.36 vs 41.15)、Precision(51.38 vs 50.51)、Recall(61.26 vs 60.70)三项指标上优于 DINO,IS 基本持平。
低质量数据鲁棒性
在长尾分布(ImageNet-LT)与低秩(Galaxy10)数据上,VISReg 能稳定防止坍塌并学到有意义的表征,而 DINO 在缺乏精细调参时直接失败。
意义
VISReg 表明,将表征正则解耦为「尺度」与「形状」两个独立组件,可得到比现有方法更稳定、更高效、泛化性更强的自监督学习方案。在不使用任何训练启发式技巧的前提下,它在识别、分割、生成引导等多个维度取得领先或接近领先的结果,以约 1/10 的数据达到 DINOv2 的 OOD 水平,为 JEPA 世界模型长期存在的表征坍塌问题提供了新的正则化解法。
