天文基础模型 AION-1 被发现系统性偏置:检测通道压制像素信号
审计显示 AION-1 严重依赖检测通道而非图像像素,导致红移测量偏置,在 12/40 项任务中超出 LSST DESC…
一项基于因果干预的审计研究指出,天文基础模型 AION-1 在处理多模态输入时严重偏向检测通道(detection channel),忽略图像像素本身的信息,导致星系分层平均红移(tomographic mean redshifts)测量出现系统性偏置,部分结果超出 LSST DESC 要求达 8.3 倍。
AION-1 模型与审计方法
AION-1 是一个 39 模态的 transformer 基础模型,训练数据来自超过 2 亿个天体对象,输入同时包含图像像素与由这些像素派生的目录产品(catalogue products)。研究团队采用因果干预方法:在保持图像 token 字节完全一致的前提下,仅修改目录中的巡天分割图(survey segmentation map),观察模型输出的变化,并以「匹配安慰剂」(matched placebo)作为基线对照。
检测通道压制像素信号
审计结果显示,仅编辑检测通道就会改变模型报告的所有物理量——包括流量、大小、椭率、红移——变化幅度达到匹配安慰剂的 110 至 4400 倍。
进一步分析揭示真正的驱动机制并非「掩膜内包含的光」,而是「目标是否处于场中心」:
- 场中心存在性:相关系数 r = 0.47
- 掩膜内光强:r = 0.30
- 在 322 个真实混合天体中,模型对光如何被分割基本无感,R = -0.006
这种偏好并非检测通道独有。当目录测光被故意矛盾化时,模型表现比「完全不提供元数据」还要差 9 倍,说明元数据通道一旦被引入就会主导模型判断。
对红移测算的系统性影响
Legacy Survey 流水线会留下 3.68% 的目标没有任何分割覆盖其位置。研究团队将该缺失率沿流水线实际返回的字段传播到红移测算中:
- 在 40 项任务分配中,红移中位偏移达到 LSST DESC 要求的 0.71 倍
- 其中 12 项超出该要求
- 若计入实际观测位置误差,最差分箱达到要求的 8.3 倍
- 即使按测得的星等依赖关系而非均匀方式抽取缺失样本,结果不变
缓解方案与额外发现
研究测试了三种干预手段:
- 光谱数据:可消除该效应
- 屏蔽检测通道:在无可测量代价的前提下消除该效应
- 模型规模:效应随模型规模增长而放大
此外,tokenizer 本身存在量化局限——图像编解码器对源 patch 仅分辨 28 个有效状态,而光谱编解码器可达 934 个;红移读出受量化精度限制。研究还指出,稀疏字典作为因果干预工具并不可靠:在 15 次测试中,恢复率横跨 26%–75%,仅改变种子即可让指标移动 18 个百分点。
研究者强调,对于依赖多模态目录元数据的天文基础模型,引入检测通道会埋下严重系统性风险;该审计方法对其他多模态基础模型的鲁棒性研究同样具有借鉴意义。
