噪声也能当老师:ICML 2026 论文用随机噪声替代源域
ICML 2026 论文 SSNA 提出用高斯噪声替代真实源数据进行迁移学习,在 8 个视觉与 1 个文本数据集上取得稳…
传统迁移学习通常依赖一个标签丰富的源域,但在隐私、版权或保密场景下,真实源数据往往难以获取。发表于 ICML 2026 的论文《Semi-Supervised Noise Adaptation: Transferring Knowledge from Noise Domain》提出一个颇具反直觉的思路:把从高斯分布中随机采样的噪声当作源域,仅借助少量目标域标注,就能让模型在半监督分类任务中获得稳定提升。围绕该论文提出的噪声自适应框架(Noise Adaptation Framework,NAF),研究团队在 8 个视觉数据集和 1 个文本分类数据集上进行了系统实验。
核心方法:迁移的不是语义,而是结构
SSNA 团队假设目标任务包含 C 个类别。他们在 1024 维空间中为每个类别随机采样一个均值向量,以单位矩阵作为协方差,构造 C 个高斯分布,再从每个分布中采样若干噪声向量。噪声域与目标域使用相同的类别索引集合,但这种对应本身并不携带语义信息。
关键设计在于:真正被迁移的不是「猫」「狗」等视觉知识,而是噪声域在共享表征空间中形成的判别结构——同一类别的噪声被压到一起,不同类别被拉开。当这套结构与目标域对齐后,就能为真实样本提供更清晰的分类边界。
少量标签仍然是必要的:噪声来自另一个空间,类别编号又是人为指定的,模型必须借助少量已标注目标样本,才能知道噪声类 0 应该和哪个真实类别对齐。当每类标注样本降为 0 时,NAF 与基线 ERM 在 CIFAR-100 上的准确率分别只有 1.34% 和 0.97%,均接近随机水平。
NAF 的三段式训练目标
NAF 把训练目标拆成三部分,对应论文给出的泛化上界:
- 真实标签监督:目标域编码器将真实样本映射到共享表征空间,分类器使用少量标注样本计算交叉熵损失。
- 噪声分类:噪声投影器将随机向量映射到同一表征空间,分类器按预设类别编号识别噪声,训练后同类噪声逐渐聚拢。
- 分布对齐:使用负域相似度(Negative Domain Similarity,NDS)同时比较两域的全局均值和各类别均值,借助余弦相似度推动它们靠近。
NDS 中未标注目标样本的类别均值,由模型产生的伪标签迭代估计。
实验结果:从 CIFAR 到 ImageNet 均有效
主实验覆盖 CIFAR-10、CIFAR-100、DTD-47、Caltech-101、CUB-200、Oxford Flowers-102、Stanford Cars-196、ImageNet-1K 和文本任务 AG News-4。除 ImageNet-1K 外,视觉任务均采用每类 4 个标注样本,其余样本作为无标注数据。
在 ResNet-18 上,NAF 相比 ERM 基线的 Top-1 提升为:
- CIFAR-10:+12.35 个百分点
- CIFAR-100:+7.61 个百分点
- DTD-47:+4.38 个百分点
- Caltech-101:+2.74 个百分点
细粒度任务上,NAF 在 CUB-200、Oxford Flowers-102 和 Stanford Cars-196 上分别比 ERM 提高 8.94、5.51 和 7.74 个百分点。在 ImageNet-1K 上(每类 100 个标注样本),NAF 达到 37.10% 准确率,比 ERM 高 0.99 个百分点。文本任务 AG News-4 上,使用 BERT 的 NAF 达到 82.82%,比 ERM 的 78.64% 高 4.18 个百分点。
NAF 还可以直接插入现有半监督方法。在 CIFAR-10 的 20 轮训练中,UDA 和 FixMatch 接入 NAF 后准确率分别提高 20.83 和 9.91 个百分点;UDA、FixMatch、FlexMatch、DebiasMatch、DST、LERM、SA-FixMatch 等方法整体均获得增益。
消融实验:起作用的是结构,不是随机性
团队通过消融实验验证,噪声起作用的关键在于类别之间是否具有可分离的结构,而非噪声数量本身:
- 把所有类别的噪声压成同一个点后,噪声域失去判别结构,CIFAR-10 准确率从 ERM 的 58.15% 跌至 33.34%,CIFAR-100 从 42.24% 跌至 6.79%,出现明显负迁移。
- 逐步拉大噪声类别中心距离时,CIFAR-100 准确率从 43.80% 一路提高到 49.78%。
- 噪声数量从每类 10 增加到 100 个时,准确率稳定在约 50%;增加到 200 个反而略有下降。
- 将噪声域简化为每类一个可学习中心点时,结果仍高于 ERM,但低于完整 NAF。
- 在 Amazon 到 Caltech-10 的迁移实验中,真实源数据仍略胜一筹,但噪声源域已能将准确率从 ERM 的 83.51% 提升至约 88%–89%。
研究团队特别强调,SSNA 与常见数据增强思路不同:数据增强通常在真实样本附近做旋转、裁剪或插值,而 SSNA 先构造一个独立的噪声域,再在表征空间中完成跨域对齐。
意义与局限
这项工作表明,迁移学习所迁移的,或许不只是「数据讲了什么」,还包括「数据在表征空间中如何组织」。在隐私受限、版权敏感或真实源数据难以获取的场景下,随机高斯噪声可以作为一种成本极低的替代源域。不过,从 ImageNet-1K 上仅 +0.99 个百分点的提升可以看出,噪声源域目前仍更适合作为真实源数据不可得时的备选,而非全面替代。
论文代码已开源,仓库地址为 https://github.com/AIResearch-Group/SSNA,arXiv 链接为 https://arxiv.org/pdf/2606.00558。
