Anthropic 悄然为所有 Claude 输出嵌入水印
Anthropic 自 8 月 2 日起在欧盟上线的 Claude 模型中加入机器可读水印,覆盖全球 Claude、AP…
Anthropic 近日确认,已在欧盟 AI 法案《实践守则》(Code of Practice)透明度条款约束下,开始为其新发布的 Claude 模型生成的全部文本嵌入不可感知的水印。该政策自 2026 年 8 月 2 日起适用于在欧盟上线的新模型,并将在全球范围内统一执行,覆盖 Claude 对话产品、API、Claude Code 以及 AWS、Google Cloud、Microsoft Foundry 等云合作伙伴。
水印如何嵌入
据 Anthropic 官方支持文档说明,当 Claude 模型生成文本时,会直接在输出内容中织入一层人眼不可见的水印,文本的可读性、质量与含义均不受影响。水印与文本本身绑定,因此在复制、粘贴或轻度编辑后仍可能保留。
对于文件类输出,Anthropic 额外叠加了一层基于 C2PA 开放标准的签名元数据——相当于为文件附加一份「数字货运清单」,记录其生产者及后续是否被修改。Anthropic 表示,水印属于「模型级」和「原生文本级」,即模型在训练阶段即被注入该能力,而非由外部工具事后添加。
检测方法尚未公开
Anthropic 尚未公布水印的具体构造方式与检测工具。研究人员推测,这是一种统计签名:模型在选词时被引导向某种微弱但可检测的偏置,思路与 Google 的 SynthID Text 类似。在官方检测器发布之前,该推测仍无法验证。
与此同时,开源社区已开始尝试去除这些标记。项目 mikiane/claude-watermark-cleaner(GitHub 上 106 星)会先清除不可见的 Unicode 字符,再用非 Claude 模型重写文本,以打乱 token 模式;规模更大的 guillaumemeyer/watermarks-remover(4.6k 星)则可同时剥离 Claude 文本水印、C2PA 以及 SynthID 类信号,覆盖 PNG、JPEG、SVG、PDF、DOCX 等格式。该项目作者认为,统计型文本水印「并不是证明来源的可靠方式」,反而迫使用户额外消耗一次模型调用来清洗自己的文字。
隐私争议与监管背景
Anthropic 的做法让部分隐私倡导者警惕。回溯至今年 3 月,Anthropic 曾因在 Claude Code 中嵌入隐藏追踪器被研究者发现而将其移除——该追踪器通过未公开的 Unicode 标记记录部分用户的地理位置和代理使用情况。如今被采用的「静默标记」技术,与彼时引发争议的手法属于同一思路。
需要注意的是,水印只能证明 Claude 参与了文本生成,而非整篇内容均由 AI 完成;用户将一段原创文字交给 Claude 润色或翻译后,输出同样可能携带标记。Anthropic 也承认,深度编辑可去除水印,缺少标记并不等于「由人类撰写」。
在美国,国会正在讨论的 COPIED Act 法案同样推动建立标准化的 AI 内容水印机制,便于平台追溯内容来源。Anthropic 尚未透露将在何时发布可被第三方使用的检测工具与阈值参数。
