Anthropic 详解 Claude 文本水印:采用 SynthID-Text,将开放检测 API
Anthropic 发布博客说明 Claude 文本水印原理,采用 Google DeepMind 的 SynthID-…
Anthropic 周五发布博客文章,进一步说明其聊天机器人 Claude 将如何为生成文本添加水印,回答了用户关心的几个核心问题:水印如何运作、编辑能否抹除水印,以及对代码生成的影响。此前 Anthropic 已宣布将引入水印机制以符合欧盟《AI 法案》透明度准则的要求。
水印的基本原理
Anthropic 在博文中首先概述了水印的概念:在做出「低风险」的选词决策时——例如在描述天气时选择「overcast」还是「grey」——Claude 会在回复中嵌入一种「读者无法察觉,但拥有对应密钥的人可以检测」的统计模式。Anthropic 强调:「水印不影响 Claude 的输出质量,对读者而言,带水印的回复与无水印回复无法区分。」
技术方案与检测工具
具体实现上,Anthropic 表示将采用 Google DeepMind 团队于 2024 年提出的 SynthID-Text 方案,并计划推出一套水印检测 API。公司同时指出,水印机制与 Pangram 等公司提供的 AI 检测方案存在本质区别:后者通过分析写作中的「痕迹」(如「这不是 X,而是 Y」这类句式)来识别 AI 生成内容,而水印则是基于密钥的主动嵌入,二者「在根本上属于不同范畴」。
编辑、改写与代码场景
针对「改写能否消除水印」的疑问,Anthropic 回应称「轻度编辑通常无法完全去除水印」,但「逐词完全重写则可能」。公司补充道,在后一种情况下,文本是否还能被称作 AI 生成,本身就值得商榷。
- 轻度校对/编辑:若只有少数词由 Claude 改写,「几乎所有词」仍出自人类作者,水印可附着的内容非常有限。
- 代码生成:由于代码必须可运行、可用词选择空间有限,整体水印强度会低于普通文本;但在注释等存在任意措辞选择的部分,仍会嵌入水印,对实际代码产出的影响可忽略。
行业层面的合规趋势
Anthropic 还在博文中暗示,Claude 并不会是唯一生成带水印文本的主流聊天机器人:「其他主要模型开发者签署了同一行为准则,也将各自实施水印方案。」这意味着欧盟透明度准则的合规要求,正在推动主流厂商集体引入水印机制,水印有望成为面向欧洲市场 AI 产品的标配。
