桃子桃子快讯
返回首页
行业动态

Claude 隐形水印上线,可证无损信息隐藏走过七十七年

Anthropic 在 Claude 全产品线部署不可关闭的隐形文本水印,回溯可证安全隐写从理论到产业落地的关键进展。

2026.08.17 · 周一6 分钟阅读

2026 年 8 月 11 日,Anthropic 宣布:自 8 月 2 日起发布的新版 Claude 模型在生成文本中直接嵌入人眼不可见、机器可读的隐形水印,覆盖网页端、API 与 Claude Code 全线产品,面向全球用户且不可关闭;同步生成的图像还将附带符合 C2PA 标准的数字签名溯源元数据。这是 Anthropic 签署欧盟《人工智能法案》第 50 条透明度行为准则后的标志性举措。

上线首日,争议焦点是「会不会伤模型」

官方文档明确,水印「不会改变 Claude 回答的语义、质量,也不会影响其可读性」。但上线当天,质疑最集中的正是:打水印会不会伤模型、降低生成质量?围绕这一问题,「可证无损」成为大模型时代信息隐藏研究的核心命题。文章以中科大团队的工作为主线,从可证安全隐写这一理论源头出发,梳理了一条从 Shannon 1949 年的设想到 Claude 2026 年上线的技术长链。

七十七年:从 Shannon 提问到 Claude 上线

1949 年,Shannon 指出建立隐蔽通信理论的困难;1998 年 Cachin 用相对熵给出信息论安全定义;2002 年图灵奖得主 Manuel Blum 指导 Hopper 等人建立计算安全隐写框架。可证安全隐写此后沉寂近二十年,核心瓶颈在于传统构造需要载体分布可精确采样,而自然数据分布不可控。

2018 年前后,生成式 AI 带来转机:模型先学到分布、再按分布采样,相当于天然拥有「显式分布或完美采样器」。中科大团队最早提出生成式可证安全隐写思路,给出「黑盒采样」与「压缩—可逆采样」两套框架,将安全性归约到加密算法安全。该工作在 IWDW 2018、arXiv 2018 陆续发表后,因彼时生成式 AI 尚未爆发,一度难获学界广泛认可;随着语音等生成模型质量提升,团队受邀在 IWDW 作题为「When Provably Secure Steganography Meets Generative Models」的大会主旨报告。

此后路线在国际上全面铺开:

  • 清华:基于样本分组的可证安全语言隐写(Findings of ACL 2021)
  • 波士顿大学与约翰霍普金斯大学:面向真实分布的密码学安全隐写 Meteor(ACM CCS 2021)
  • 牛津大学:基于最小熵耦合的完美安全隐写(ICLR 2023)
  • 中科大:基于分布副本的 Discop(IEEE S&P 2023),显著提升嵌入载荷率

同年,《Quanta Magazine》将「在生成数据中完美隐藏秘密信息」评为年度国际计算机科学七大突破之一。

三条新路线:公钥、无盒与灰盒

早期方案均为对称密钥体制且依赖白盒提取,使用场景受限。中科大团队进一步将路线推向公钥化、无盒/灰盒化,并消除了子词歧义。

  • 公钥隐写(IEEE TIFS 2024):将椭圆曲线密码(ECC)与生成模型结合,给出可证安全公钥隐写方案与隐写密钥交换协议,解决「非对称」提取问题。
  • 无盒隐写(IEEE TMM 2026,Disreo):通过 token 位置随机化与输出概率重组实现无盒提取,接收方无需持有底层模型即可恢复消息。
  • 灰盒隐写(ACM CCS 2026,SpecStega):基于推测采样,由收发双方共享的小模型完成嵌入与提取,再借助目标大模型精炼输出,载荷率相对现有黑盒方案提升 20 倍以上。
  • 子词歧义消除(IEEE TDSC,SyncPool):嵌入前将存在前缀关系的 token 统一分组,从原理上消除解码歧义,实现可靠提取。

从隐写到水印:「可证无损」落地 Claude

可证安全隐写理论上保证载密数据与正常生成数据分布不可区分,这正契合「可证生成质量无损水印」的定义。在文本领域,中科大团队开发的即插即用系统已应用于星火大模型与安全 GPT 模型平台,服务超过 1.3 万名开发者,支持单比特鲁棒鉴别与多比特模型归因。

国际同行同样在推进:

  • 马里兰大学等:《Unbiased Watermark for Large Language Models》(ICLR 2024 Spotlight)定义无偏水印并给出通用构造
  • 斯坦福:抗失真的鲁棒无偏水印(TMLR 2024)
  • 多通道无偏水印 MCmark(ACL 2025):在严格无偏前提下提升提取鲁棒性

图像领域的可证无损方案也在快速落地:

  • Gaussian Shading(CVPR 2024):把加密随机化后的水印映射为与正常生成不可区分的高斯潜变量,即插即用、可证无损
  • Gaussian Shading++ 与 T2SMark(NeurIPS 2025):解决鲁棒性、生成参数变化与多样性问题
  • TAG-WM(ICCV 2025):模板水印 + 信息水印双机制,同时支持篡改定位与权属确认
  • SemBind(ICML 2026):用语义掩码器抵御黑盒伪造攻击

借鉴图灵奖得主 Shafi Goldwasser 等人在 FOCS 2022 提出的「可证明不可检测后门」构造,中科大团队进一步提出可证性能无损的黑盒模型水印协议(IEEE TDSC 2026),将性能无损性归约到密码学安全,「可证无损」由此从生成内容延伸到了模型本身。

攻防的本质:代价博弈

Anthropic 上线首日的争议集中在两件事:写作者担心署名归属,开发者担心「水印会不会降低质量」。行业先行者选择了「工程化快跑」,而「打得准、不伤身、经得起改写与擦除、还能给出确定证据」需要坚实的理论支撑。

设计水印要同时追求质量无损与鲁棒性,攻击者也要在质量约束下擦水印——没有了约束,水印很容易擦除。防守方不愿因嵌入牺牲生成质量,攻击方也不愿因擦除损失质量,「无损」是双方共同的约束和目标。从 Shannon 设想到 Claude 上线,信息隐藏走过了七十七年,从「经验安全」跨越升级到「可证安全」,把「担心嵌水印伤模型」变成「数学上证明无损」,为 AI 内容治理提供了有理论保证的技术支撑。

信源