桃子桃子快讯
返回首页
研究论文

实证研究质疑 AI 水印取证可靠性

学术论文测试三种主流 LLM 水印方案,发现面对改写攻击几乎全部失效,无法满足法庭采信标准。

2026.07.20 · 周一3 分钟阅读

2026 年 7 月 17 日发表在 arXiv 上的一篇学术论文,对当前主流大语言模型水印方案的取证可靠性提出严峻质疑。研究团队通过实证测试发现,三种代表性水印方法(KGW、Unigram、SynthID-Text)在面对保留语义的改写攻击时几乎全部失效,且假阴性率极高,无法满足美国《联邦证据规则》Daubert 标准的法庭采信门槛。该结论直接挑战了欧盟 AI Act、加州 SB 942 等法规所依赖的「水印可作为有效证据」的核心假设。

研究背景:水印取证的法律前提未经验证

随着生成式 AI 的普及,多国监管机构开始要求 AI 生成内容必须携带可识别水印。欧盟 AI Act 要求标记「足够可靠、足够稳健」,加州 SB 942 则要求披露标识「永久或极难移除」。然而这些法规都建立在一个未经实证检验的假设之上——即水印检测结果能够达到法庭采信所需的证据可靠性。该研究正是对这一前提的直接检验。

方法:FRS 框架与三种代表性水印方案

研究团队评估了三种代表性水印方法:

  • KGW:经典基于 token 偏置的 LLM 水印方案;
  • Unigram:以单字为单位的水印方法;
  • MarkLLM 实现的 SynthID-Text:Google DeepMind 提出的工业级水印方案。

研究采用 NIST SP 800-86 数字取证流程,并对照 Daubert 法庭采信标准,提出包含 12 项评估准则、3 道强制关卡、60 分制评分的「Forensic Readiness Score(FRS)」框架。攻击向量选择了保留语义的改写——因为这在法律现实中最常见,也最难被驳斥为证据篡改。

关键发现:水印几乎全部失效

在 15 个不同提示词、每种方法 846 次有效改写实验中:

  • KGW 与 Unigram:100% 条件性移除——所有初始可检测的水印文本在改写后全部丢失水印;
  • SynthID:稍好,但仍达 98.3% 的移除率;
  • 即使在没有任何攻击的原始情况下,假阴性率已很高:KGW 70%、Unigram 83%、SynthID 80%;
  • SynthID 配置将 5.4% 的改写后人类文本误判为 AI 生成;
  • SynthID 存在 18.6% 的悖论率,其自身 80% 的干净水印输出落入「不确定死区」;
  • 三种方法在 Daubert 五项标准中均未能满足超过两项。

结论与政策含义

研究明确指出,「按测试配置,这些方案未能达到法庭所需的证据标准」。FRS 评分体系虽按设计运行,但「无法完全捕捉取证无用性」——这一点对未来框架设计也具有警示意义。该论文已提交至 AAAI/ACM 人工智能、伦理与社会会议(AIES 2026),全文 9 页、含 4 张图表。这意味着监管机构、行业厂商与司法系统在依赖 AI 水印作为合规与取证手段时,需重新审视其技术可行性基础。

信源