提示词插入随机词可削弱 AI 输出水印
有用户提出,通过提示词让模型插入随机词再剔除,可破坏 Anthropic Claude 输出水印的统计偏置信号。
Anthropic 本月为 Claude 的输出引入了水印机制,业内预计其他厂商也将跟进。与传统的「用长破折号代替减号」这类排版手段不同,Claude 的水印更可能借鉴 Google 的 SynthID:在模型从预测的下一 token 分布中采样时,引入基于伪随机生成器的统计偏置,从而在事后被检测出来。这一思路在 Hacker News 上引发讨论,有用户提出了一种在提示词层面削弱水印的思路。
水印依赖「表达自由度」
水印的有效性取决于回答中是否存在足够的随机性。如果向模型提出开放式问题,模型在选词上有较大自由度,水印信号就能稳定嵌入;反之,如果要求模型逐字复述一段已知文本(例如美国宪法),回答没有「表达自由度」,水印便无从引入。从这个角度看,水印回答的核心问题是「谁真正决定了措辞、消耗了熵」,而非「谁最后经手了这段文本」。
翻译削弱水印,但效果不确定
由于目前尚无公开工具可检测文本的水印概率,文中提到的相关推测均无法验证。一个直觉是:将文本从一种语言严格直译为另一种语言,会比意译更大幅度地削弱水印——因为直译同样缺乏表达自由度。不过,由于检测工具未发布,翻译究竟需要多「严格」才能破坏水印,目前并无定论。
提示词插入随机词的方案
作者提出的方案是:让模型在回答中以高频率、随机间隔插入某一高熵类别的词(例如全大写的动物名),事后要求模型在不带这些插入词的情况下复述自身回答。如果模型按指示执行,最终得到的干净文本将「吃掉」水印所依赖的伪随机链:
- 插入的高熵词占据了原本可供模型自由选择的位置,消耗了采样时的统计偏置信号。
- 事后剔除这些词时,词与词之间的伪随机依赖链被打断,事后重建 token 序列概率分布的努力将丢失这部分表达空间。
- 最终的「复述」任务几乎没有表达自由度,模型无法再引入新的偏置,这与逐字背书宪法类似。
文中给出的示例提示要求模型每三到五个词插入一个全大写的动物名,并在最后要求模型去除这些动物名后再输出。作者用 ChatGPT 5.6 Sol(高算力档)做了测试,并表示相比 Claude,ChatGPT 更愿意遵循这一复杂指令。文中展示了模型在响应中确实散布了 OTTER、IBEX、MACAW、WOMBAT 等随机词。
局限
- 整个方案的前提是「模型必须按指示执行」,属于软性绕过而非硬性破解;模型若拒绝插入或拒绝复述干净版本,方案即失败。
- 由于水印检测工具未发布,作者承认所有相关论断都无法实测验证。
- 该方案会改变生成过程的内容形态(例如可能残留直译痕迹或异常措辞),并非无损去除水印。
