FlowGuard:通过内部信息分解守护多模态大模型
针对多模态大模型跨模态攻击,论文提出基于偏信息分解的轻量级推理时防御框架,可将攻击成功率从 90% 以上降至 15% 以…
多模态大语言模型在视觉与文本联合推理中展现出强大能力,但同时也引入了传统单模态系统所没有的攻击面:攻击者可以将恶意意图分散到不同模态,从而绕过针对单一模态的安全防护。近日发表于 arXiv 的一篇论文提出了一种名为 FlowGuard 的轻量级推理时防御框架,通过监测模型内部的跨模态一致性来识别有害输入。
问题:跨模态攻击让单模态检测失效
论文指出,多模态模型的输入同时包含图像与文本,攻击者可以将恶意指令拆分到两个模态中,使每个模态单独看上去都是「无害」的。现有防御机制大多在原始输入或最终输出层面做检查,无法捕捉模态融合过程中的异常,因此既脆弱又计算昂贵。
核心思路:跨模态一致性作为检测信号
作者观察到,在良性输入下,仅文本与仅视觉两条推理路径的预测行为是兼容的,融合后会趋于稳定;而在对抗性扰动下,这种一致性会被破坏,导致多模态融合后产生异常行为。FlowGuard 不依赖传统的标量置信度,而是借助「偏信息分解」(Partial Information Decomposition, PID)的方法,从模型内部提取出称为 FlowVectors 的表征,用以量化跨模态之间的:
- 冗余信息(redundancy)
- 协同信息(synergy)
- 模态特异的主导性(modality-specific dominance)
这些维度共同刻画「融合后的多模态预测是否仍与单模态语义证据保持一致」。
方法:FlowGuard 与单类分类
FlowGuard 在推理阶段运行,不修改模型权重。系统在一个仅由良性数据训练的单类分类问题中学习正常 FlowVectors 的分布,推理时若输入产生的 FlowVector 偏离该分布,则判定为潜在攻击。该设计避免了收集对抗样本的高成本,也无需对攻击类型做先验假设。
实验结果
论文在未见过的攻击类型上评估了 FlowGuard 的表现,主要数据如下:
- 攻击成功率(Attack Success Rate):从 90% 以上降至 15% 以下
- 正常任务效用损失:小于 3%
- 相比基线方法,延迟最高降低 6 倍
作者认为,这些结果表明监测跨模态一致性是一种高效且有效的多模态推理防御手段,为多模态大模型在实际部署中的安全防护提供了一条新路径。
