Claude 文本将嵌入机器可读水印,8 月起覆盖全平台
Anthropic 宣布 8 月 2 日后发布的 Claude 新模型将为文本嵌入不可见水印,并附带数字签名元数据,覆盖…
人工智能公司 Anthropic 近日更新官方说明,宣布自 8 月 2 日起发布的 Claude 新模型将支持机器可读的内容标记,生成的文本会嵌入肉眼不可见的水印,8 月 2 日之前发布的旧模型则会享受一段过渡期。这一变化覆盖 Claude、Claude Platform(API)、Claude Code、Cowork,以及通过 AWS、Google Cloud、Microsoft Foundry 等云平台调用的所有 Claude 产品形态。
水印覆盖范围与基本原理
按照 Anthropic 的官方说明,文本使用嵌入式水印,文件则附带带数字签名的出处元数据(C2PA 标准)。水印嵌入文本后不会改变原文的含义、质量和可读性;由于水印本身是文本的一部分,将其复制到 Word、公众号后台或转发给他人时,水印也会随之传递,即使经过一定程度的编辑仍有可能保留。
更关键的是,水印是在模型层面打上的。只要底层模型支持水印,无论通过哪个产品形态输出,理论上都会留下水印。这意味着简单的复制粘贴、截图 OCR,甚至手动逐字重新输入,均无法摆脱水印标记。
技术路线参考
Anthropic 目前并未公开具体实现细节,但学术界已有多种给大模型输出文本打水印的研究路径。
- 经典 token 层方案:2023 年 ICML 论文《A Watermark for Large Language Models》提出,每生成下一个 token 前按秘密规则把候选词划分为「绿名单」和「红名单」,并略微偏向绿名单中的词。单次差异不可察觉,但累积的统计规律可被检测器识别。
- 同类工业实践:Google DeepMind 的 SynthID-Text 思路类似,其 Nature 论文显示,经过近 2000 万次真实交互的线上实验,水印未对回复质量产生明显影响。
- 语义层方案:ICLR 2024 一项研究把前文整体语义信息纳入水印设计;后续工作还在探索 embedding 空间、句子语义、不同改写器的表达偏好中编码信号,使简单同义词替换难以去除。
业内对 Claude 具体技术路线的猜测包括 token 概率调控、特定措辞句式编码、语义结构嵌入等,但目前均未得到 Anthropic 确认。
已知局限与争议
Anthropic 在文档的「局限性」部分明确指出:若文本被大幅编辑、改写、翻译或与其他文字混合,水印可能检测不到;过短文本、被删除元数据的文件,以及由不支持水印模型生成的文本,同样会影响检测效果。官方检测工具暂未发布,仅表示未来将支持用户和第三方对 Claude 标记进行检测。
更重要的是,Anthropic 自身强调:检测到水印只能作为「该内容可能被 Claude 处理过」的信号,并不能证明整篇文章由 Claude 独立生成;反之,未检测到水印也不能排除与 Claude 有关,可能是水印被改写破坏,也可能生成时未启用水印模型。这一「既不能定性也不能脱罪」的灰色地带,是当前方案最被诟病的部分。
水印背后的治理博弈
业界反应明显分化。部分用户对全平台「无差别打标」表达不满,担心增加使用成本;也有观点认为这是推动 AI 内容治理的重要一步。在虚假新闻、批量垃圾内容、学术代写检测等场景下,水印确实提供了一种相对可靠的技术溯源手段。
更具反思意味的是另一种情绪:当 AI 学着模仿人类写作,人类反过来要自证「不像 AI」。很多人真正介意的,并非文字中多了一个看不见的标记,而是未来又多了一轮自证清白的时刻。
