桃子桃子快讯
返回首页
产品功能

Claude 文本水印为何难敌改写

Anthropic 计划以 SynthID 为 Claude 文本加入统计水印,改写可削弱检测信号。

2026.08.18 · 周二2 分钟阅读

Anthropic 宣布将为 Claude 生成的文本加入隐形水印,技术方案采用 Google DeepMind 开发的 SynthID。它并非在文本生成完成后附加标记,而是在逐个 token 的选择过程中施加概率偏置,再通过较长文本中累积的统计特征完成检测。

统计偏置而非固定词表

大语言模型通常根据已有上下文,为下一个 token 计算候选词及其概率,再完成一次选择。SynthID 不要求模型固定选择某个词,也不会删除原有候选项,而是按照只有检测方掌握的规则,在采样前轻微调整部分候选 token 的得分。

例如,在补全「这部电影真____」时,假设「好看」「厉害」「精彩」原本分别具有较高概率,SynthID 仍可能让其中一些选项变得更容易被抽中。随着上下文变化,每一步的概率都会重新计算,因此不存在一张固定的水印词表。检测方需要观察大量生成选择,寻找与秘密规则持续吻合的统计偏好,而不是寻找某个肉眼可见的特殊字符。

改写可能破坏信号

文本水印与词语选择深度结合,也意味着同义替换、主动语态与被动语态转换等普通编辑,都可能削弱水印的统计关系。将文本交给其他模型重新生成,则可能进一步改变原有 token 序列。原文称,GitHub 上已经出现专门针对这类水印的移除工具。

这使水印防御与规避形成持续对抗:防御方希望信号在复制和编辑后继续存在,攻击方则试图以较低成本破坏统计信号。检测工具与改写工具的发展,也让这场攻防从理论讨论转向真实工具之间的较量。

技术机制影响写作选择

Anthropic 与 Google 强调,SynthID 的设计目标是不改变文本语义、质量和可读性。较轻的概率偏置是否会造成用户能够感知的质量差异,目前仍需要进一步证据。

更根本的问题在于,模型选择词语时可能增加一个与「怎样把这句话写好」无关的目标:确保文本未来能够被识别。用户为了规避检测而改写时,措辞又会受到「怎样改到无法识别」这一目标影响。即使双方都声称尽量保留原意,具体措辞也不再完全由自然、准确、清晰和风格决定。

因此,文本水印的争议并不只是技术是否足够隐蔽,也涉及水印系统可以在多大程度上介入语言表达。检测能力与规避能力持续升级时,写作本身所依赖的风格、节奏和精确表达,仍需被纳入技术方案的考量。

信源