桃子桃子快讯
返回首页
研究论文

JUMP:面向微调扩散语言模型的单轮成员推断新攻击

提出 JUMP 攻击方法,在微调 LLaDA-8B 上将成员推断 ROC-AUC 从 0.82 提升至 0.90,仅需单…

2026.07.21 · 周二3 分钟阅读

背景:扩散语言模型的隐私风险浮现

成员推断攻击(Membership Inference Attack, MIA)旨在判断某个候选样本是否曾出现在模型的训练数据中,是衡量模型隐私泄露风险的重要手段。现有研究大多针对自回归语言模型,而对一类新兴的离散扩散语言模型(discrete diffusion language models, dLLMs)的隐私研究相对薄弱。

与自回归模型逐个 token 生成不同,dLLMs 通过反复去噪并行生成文本,在推理时具备「任意顺序可解码」与「并行可解码」两条性质。此前唯一针对 dLLM 的攻击方法 SAMA 将任意顺序接口仅视作随机化手段,需要对目标模型和参考模型进行大量查询,效率受限。本工作正是针对这一空白提出改进。

JUMP 方法:一次查询完成打分

JUMP(Joint Uncertainty-Guided Mask Probing)的核心思路是同时利用 dLLM 的两条独特性质:

  • 任意顺序解码:被用来挑选参考模型置信度较低的位置,定位最可能泄露成员信息的 token。
  • 并行解码:被用来一次性联合 mask 所有选中的位置,通过对目标模型和参考模型的各一次打分查询,得到统一的重建差距统计量。

具体而言,JUMP 先用一个「选择轮」对候选位置进行筛选,再用一个「打分轮」对所有选中位置做联合遮蔽与重建,最终计算经截断处理的目标/参考重建差距,作为成员分数。整个流程对每个模型仅需一次选择查询和一次打分查询,远低于 SAMA 的多轮查询开销。

实验结果:六领域全面提升

研究者在微调后的 LLaDA-8B-Base 上,沿用 MIMIR 的六个领域基准对 JUMP 与 SAMA 进行对比。主要结果包括:

  • 平均 ROC-AUC 从 SAMA 的 0.82 提升至 JUMP 的 0.90,绝对提升 8 个百分点。
  • 在低误报率(FPR)区段的检测能力有「实质性提升」,这对实际攻击场景中的可用性尤为关键。
  • 查询开销显著下降:JUMP 仅需对目标模型和参考模型各做一次选择轮和一次打分轮,而 SAMA 需要多轮随机化查询。

这些结果表明,利用 dLLM 的并行解码结构特性,可以同时提升成员推断的准确性与效率。

意义与局限

该工作首次系统展示了 dLLM 的并行解码特性同时是「双刃剑」:既带来推理速度优势,也暴露了新的隐私攻击面。JUMP 的单轮特性使得此类攻击在实际部署场景中更可行,对未来 dLLM 的隐私防护设计提出了更高要求。

需要注意的是,本文为 arXiv 预印本,尚未经过同行评审;目前仅在 LLaDA-8B-Base 一个模型族与 MIMIR 六个领域上验证,方法在其他扩散语言模型与更大规模设定上的泛化情况仍有待进一步检验。

信源