实测:普通读者难以识别 AI 生成文本水印
作者搭建在线测试,发现读者区分水印与无水印 AI 文本的能力接近随机猜测。
围绕 AI 文本水印(特别是近期 Anthropic 宣布将在 Claude 输出中嵌入水印的争议),独立开发者 sgoedecke 做了一个小型实测:他让读者在「带水印」与「不带水印」的 AI 回复中猜哪条有水印,结果显示普通读者基本无法分辨。
实验设计与方法
作者在 GitHub Pages 上搭建了一个静态测验站点,对同一提示词生成三组回复,其中一组使用 SynthID-Text 嵌入水印,另外两组为普通输出。读者需要在三选一中猜出哪条带水印,10 道题共 10 分。
模型选用的是 Qwen3-30B-A3B-Instruct-2507,部署在租来的 H200 上,30 条回复生成成本约 2 美元。流量统计通过 Umami(托管于 PikaPods)按页面访问聚合完成。
- 生成模型:Qwen3-30B-A3B-Instruct-2507
- 水印方案:SynthID-Text
- 题目数量:10 题,每题三选一
- 总参与人次:超过 350 人
第一轮结果:偶然出现的 6 分聚集
未洗牌前共有 278 人参与。结果分布如下:
- 0–2 分:57 人
- 3 分:64 人(接近随机期望)
- 4–5 分:93 人
- 6 分:51 人(异常聚集)
- 7–9 分:13 人
- 10 分:0 人
平均得分 3.92,高于纯随机猜的 3.33。作者发现,水印答案恰好是选项 A 的题目有 6 道,于是只选 A 的用户也能拿到 6 分,造成了第二处聚集。
洗牌后的结果:回到随机水平
打乱选项顺序后,新一轮 73 人参与。结果分布回归正常:
- 平均分:3.4,与纯随机猜测的 3.33 几乎一致
- 得分分布集中在 3–5 分,未再出现 6 分尖峰
- 没有人拿到 9 分或 10 分
作者承认这不是严格的科学研究,但结合两轮数据,结论倾向明显——读者无法在三个并排回复中可靠识别出被 SynthID-Text 标记的那一条。
为什么人眼分不出水印
作者给出的简短解释是:大模型在生成时本来就会从概率最高的若干 token 中随机挑选,水印只是把这种随机性替换成一种「虽然仍然随机但可预测」的偏置。例如,原本是「从前三个 token 中随机选」,水印可以是「统计前十个 token 的字符数取模 3,再选对应 token」。对人类读者而言,两种选法在文本质量与可读性上并无显著差别。
讨论与局限
这篇文章的初衷之一是为水印争议提供一个直观参照:当数学论证不易被直觉接受时,亲眼读一读水印与无水印版本的对比,或许能让人相信——水印既不会让文本变差,也不会让 AI 输出变得更容易被肉眼识别。
需要指出的局限包括:
- 样本规模较小,洗牌后仅 73 人
- 统计方式基于页面访问而非严格去重
- 三选一形式的难度上限有限
尽管如此,作为一项公开透明的实测,它仍为「水印会影响用户体验」「水印会显著暴露 AI 内容」等常见担忧提供了一个反例。
