桃子桃子快讯
返回首页
行业动态

Anthropic 为 Claude 新模型加入隐形水印,上线 24 小时即遭破解

Anthropic 宣布 8 月 2 日起新 Claude 模型内置文本水印,但 GitHub 很快出现绕过工具,引发关…

2026.08.25 · 周二3 分钟阅读

美国人工智能公司 Anthropic 日前宣布,自 8 月 2 日起发布的新版 Claude 模型将在生成内容中嵌入人眼不可见的机器可读水印,用于标识文本由 Claude 原生输出。这是主流大模型厂商首次在新模型上线时就默认开启内容溯源机制,引发行业广泛关注。

值得注意的是,目前该水印方案仅作用于 Claude 自身的生成结果,并不能识别其他厂商模型产出的文本。也就是说,水印是一张「单方证明」,而非通用检测器。

水印如何藏在文本里

Anthropic 没有采用在文末添加「本文由 AI 生成」这类显式声明的做法,而是将水印「编织」进了模型选词的底层统计过程中。其原理可以拆成三步理解:

  • 模型生成文本本质上是逐 token 的「选择题」,在「今天天气寒冷且……」之后,候选词可能有「阴沉的」「灰暗的」等多个相似选项。
  • 在没有水印的情况下,模型选择哪个词接近随机;引入水印后,模型会依据一张「暗号本」,在统计层面优先选择特定 token,使最终文本带有可被检测的统计偏置。
  • 由于这种偏置分布在成百上千个 token 中,单看一句话很难确认,但若全文都贴合暗号本规律,就能以高置信度判定为「AI 生成」。

这种方案的优点是抗复制粘贴、抗下载转存,文本表面看起来与普通内容没有区别;缺点是依赖统计信号,本质上是一个概率问题。

上线 24 小时即被绕过

水印功能上线仅一天,GitHub 上就出现了名为 watermarks-remover 的开源破解工具。其思路简单直接:用一个无水印的大模型对原文进行大幅改写、同义词替换、句式调整,破坏原有的 token 统计规律,就能让检测器失效。代价是原文的修辞与文风可能受损。这一事件再次说明,在开源生态面前,依赖单一算法的内容锁死方案往往演变为长期攻防战。

创作者面临的「辅助 vs 代笔」困境

围绕水印技术,写作者群体表现出复杂的情绪:

  • 乐观者认为,水印是一道筛子,有助于在 AI 批量生成文本的环境下,凸显纯人工创作的价值。
  • 担忧者则指出,水印无法区分「AI 原创」与「AI 辅助」。许多写作者仅用 AI 做查资料、校对、润色,思路仍属原创,但文本依旧会被打上 AI 烙印,若检测工具被滥用,存在误伤风险。

事实上,从作家郝景芳因新作 AI 参与度引发的争议,到英国侦探小说家安东尼·霍洛维茨公开承认在创作中使用 ChatGPT,类似争论已在文学界反复出现。水印技术的落地,并不能终结关于「AI 介入多少算辅助、超过多少算代笔」的边界讨论,反而让这道题变得更加紧迫。

信源