研究论文
DiSCO:面向文生图模型的黑盒安全防御方法
arXiv 提出 DiSCO 方法,通过分布引导的对比提示优化,在黑盒设置下降低文生图模型的 NSFW 生成成功率。
2026.08.19 · 周三约 2 分钟阅读
随着 Stable Diffusion、Midjourney、Sora 等文生图模型的广泛应用,其生成不当内容(NSFW)的安全风险持续受到关注。来自 arXiv 的最新论文提出了一种名为 DiSCO 的零样本黑盒防御方法,无需访问模型内部或重新训练,即可在提示层面拦截对抗性攻击。
研究背景:白盒防御的局限
现有针对文生图模型的防御手段大多基于白盒假设,例如对文本编码器进行优化、编辑模型权重或在推理阶段进行干预。这类方法对闭源商用模型几乎不可用。此外,基于大语言模型提示重写的黑盒方案在面对「良性对抗」问题时表现不佳——这类提示在语言层面看似无害,却因模型学到的数据分布而触发不安全生成。
DiSCO 方法核心思路
DiSCO 将防御完全置于提示层面,作为即插即用模块运行,主要包含三个设计要点:
- 零样本、严格黑盒:不依赖模型参数、梯度或微调,可直接用于任何文生图系统。
- 分布引导的后缀扩展:通过束搜索在原始提示后追加后缀,由目标模型自身产出的安全与不安全图像池进行对比打分来引导搜索方向。
- 迭代自适应反馈:在生成内容仍不安全时反复优化,直至输出符合安全要求。
实验结果
研究者在 I2P 基准上评估了 DiSCO 在多种红队攻击下的表现:
- 对未防御模型,攻击成功率(ASR)下降 37.7%。
- 对已有防御措施的模型,ASR 进一步下降 25.13%。
- 在降低有害生成的同时,图像语义保真度和视觉一致性未出现明显退化。
意义与适用场景
作为一种架构无关的黑盒模块,DiSCO 可以直接挂载在商用或自托管文生图系统前端,无需改动模型本身。对于缺乏模型内部访问权限的部署方而言,这一特性显著降低了安全防御的工程门槛。不过,论文主要在 I2P 基准上进行验证,该方法在更大规模真实场景与跨模型迁移中的稳定性仍有待后续工作进一步检验。
