研究称 CNN 匹配 V1 的现象多为评估分辨率假象
一项预印本指出,未训练 CNN 在 V1 表征相似性上超越反向传播训练网络的结论主要是评估分辨率差异造成的假象,并披露三…
核心结论
一项发表于 arXiv 的预印本指出,此前被广泛引用的「未训练 CNN 在表征相似性分析(RSA)上可媲美甚至超越反向传播训练 CNN」的结论,很可能是评估分辨率差异造成的假象。同时研究披露,三份早期预印本存在批归一化(BatchNorm)的评估模式缺陷,目前已在 arXiv 上完成勘误。
研究设计
作者团队搭建了一套小规模实验框架:一个 32 像素分辨率、在 CIFAR-10 子集上训练的 CNN,对比五种学习规则——随机初始化、反向传播(BP)、反馈对齐、预测编码、STDP。实验以 THINGS-fMRI 刺激集为输入,在权重与归一化参数固定的前提下,分别在 32、64、96、128、192、224 像素六种分辨率下评估各规则与初级视觉皮层 V1 的表征相似度。
关键发现:分辨率差异反转
研究的主要结果是,训练与未训练 BP 模型在 V1 上的差距并非单调变化:在 32 像素时该差距为 −0.001 ± 0.007,几乎可以忽略;而在 224 像素时扩大至 +0.044 ± 0.006,训练模型显著优于未训练模型。该模式在全部六个分辨率区间内保持一致(n=5 seeds),说明低分辨率恰好是未训练网络表现最佳的「甜蜜点」。
为排除混淆因素,作者额外引入完整训练轨迹、人类 fMRI、方向性单种子猕猴电生理记录,以及两种现成的 224 像素训练模型(ResNet-50、Swin-Tiny)作为对照。这些模型同样在低分辨率下出现峰值,进一步坐实了分辨率的独立作用。
排除项与残余效应
在位精确权重(bit-identical-weight)干预下,研究系统排除了多种替代解释:训练/评估分辨率匹配问题、Gabor/像素级低层结构、未训练基线未校准的批归一化,以及池化特征向全局亮度收敛。其中值得注意的是,仅标量亮度与 V1 的 ρ 达到 0.075,几乎等同于未训练网络自身的 0.076,作者认为这一发现本身对 RSA 比较方法提出了警示。
内容 vs 池化控制实验(将图像细节截断为 32 像素再上采样,对比允许内容变化的设置)进一步表明,依赖来自图像内容本身而非池化位置数量。
唯一在所有分辨率下均成立的学习效应是反向传播在 LOC(侧枕叶皮层)上对未训练网络的超越,意味着学习确实带来了可测影响,只是落在传统 V1 比较区域之外。
影响与勘误
论文指出分辨率效应在神经科学与 AI 交叉领域并非首次被忽视,Laskar et al. 2018 即讨论过感受野匹配问题;作者认为这一方向具有提示意义但尚未直接验证,欢迎同行针对该讨论框架提出反馈。研究还披露了一个意外收获:在三份早期预印本中发现了 BatchNorm 评估模式 bug,相关作者已在新一轮发布中完成修正。
