梳理 AI 文本检测与水印技术演进、脆弱性边界及国内外监管框架,涵盖 Claude、SynthID 与国内标识办法。
1949 年贝尔实验室的克劳德·香农在《保密系统通信理论》中提出:任何通信系统产生的消息都无法完全摆脱其来源的统计特征。这一论断在 77 年后被 AI 文本生成推到了一个全新的具体形式——2026 年 8 月,Anthropic 宣布将在 Claude 模型生成的文本中全面部署不可见统计水印,并逐步覆盖既有模型,几乎同一时间社交媒体上关于「AI 写作会不会被发现」的争论此起彼伏。如果回到香农的框架,这件事其实早已注定:AI 内容能被识别,没有悬念;真正的问题是用什么方式识别、谁来识别、识别之后意味着什么。
香农的命题早在 AI 出现前就被反复验证。1964 年,哈佛统计学家莫斯特勒和华莱士用「功能词频率」破解了《联邦党人文集》12 篇争议文章的作者归属——他们统计 and、to、while 等虚词在已知署名文章里的出现概率,再用贝叶斯模型比对争议篇目,最终几乎确定全部 12 篇出自麦迪逊之手。这套方法后来被称为文体计量学(Stylometry),被用于法庭匿名信鉴定与文学争议分析,1995 年 FBI 还用类似方法协助锁定「邮件炸弹犯」卡钦斯基。其核心逻辑是:一个人选词的概率分布在统计层面有稳定的个人特征,刻意控制无法完全消除。同理,今天的大模型既然是「一种语言」,它同样有可能被追踪。
语言模型生成文字的过程,是每一步计算下一个词的概率分布、从分布里采样、再做下一次计算。面对同一上下文,不同模型给「改变」「重塑」「影响」「颠覆」分配的概率存在系统性差异,单次差距微小,但几百到几千次累积后会在整篇文章的统计结构里留下可辨别的轮廓。
2023 年斯坦福米切尔等人发表的 DetectGPT 研究发现:某语言模型生成的文字往往处于该模型概率函数的「局部极大值」附近;对它做局部随机改写后,改写版本通常落到更低概率位置。利用这种曲率特征,在完全不需要预先嵌入水印的情况下即可判断一段文字是否更可能由某模型生成。在针对特定模型生成假新闻的检测实验中,DetectGPT 将命中率从此前的 0.81 提升到 0.95。
被动检测的天花板很快显现。OpenAI 2023 年 1 月推出 AI 文本检测工具,5 个月后以「准确率太低」为由下线——它在自己评估集上仅正确识别 26% 的 AI 写作,同时把 9% 的人类文章误判为 AI。这说明:「AI 内容有统计特征」与「存在可靠的通用检测器」是两件不同的事。
国内平台在落地 AI 内容标识时遭遇同样现实。2025 年 9 月 1 日,四部门联合发布的《人工智能生成合成内容标识办法》正式施行,抖音、快手、小红书、B 站、微博同日上线 AI 内容标识功能。但第三方评测显示,平台自动识别能力参差不齐:快手首周表现尚可,抖音几乎失灵;到 10 月下旬另一家媒体的评测又翻转过来。各平台受限于技术与算力成本,主要依赖视频自带 AI 水印或作者主动声明。
被动检测不够用,厂商开始尝试在生成过程中主动嵌入只有自己才能识别的印记。Google DeepMind 在 2023 年 8 月率先把这一逻辑做成大规模商业产品 SynthID,初期用于图像——在像素层面写入一个统计信号,人眼无法察觉,检测算法可识别,对裁切、压缩、滤镜具有一定抵抗性。随后扩展到音频、视频,2024 年 5 月扩展到文字,部署在 Gemini 对话界面。
文本水印的机制是:在模型生成每个词之前,按带密钥的算法对词汇概率分布做极微小调整,使最终词汇选择序列在统计上符合一个隐藏规律。具体方法被称为「竞赛采样」,通过调整词汇之间的竞争规则来编码信息,整篇文章表面完全正常,信号藏在「每次选了哪个词而没选哪个词」的统计模式里。Google 在近 2000 万条 Gemini 用户响应中对比加水印与不加水印版本,用户满意度评分没有显著差异。
2026 年 5 月的 I/O 大会披露:SynthID 已对超过 1000 亿条 AI 生成图像和视频打上水印,AI 生成音频标记量相当于 6 万年播放时长,Gemini 用户主动发起的验证累计 5000 万次。OpenAI、英伟达等也加入 SynthID 生态,Google 同时将 SynthID 验证能力推进到搜索和浏览器工具。
国内的政策方向则要求 AI 模型在数据结构中主动留痕。《标识办法》第 5 条要求文件数据结构写入服务提供者编码、内容编号、生成属性等元数据;第 12 条明确服务提供者在算法备案时应提交标识相关材料。截至 6 月末,国内已有 998 余款大模型完成备案、598 余款在省级部门完成登记,生成式 AI 产品用户规模超过 2.3 亿人。元数据方案合规成本更低、验证更容易,但无法应对生成级水印针对的同质化批量生产者。
流传甚广的「截图 + OCR 消除水印」说法对元数据层成立,但生成级水印不会因此消失——水印是通过影响词汇选择编码的,截图转像素再 OCR 回文字,还原序列与原文基本一致,水印仍然存在。真正能消灭生成级水印的是「重新生成语言」:不看原文,从头写意思相近的表达。
2025 年 WaterPark 基准测试对 10 种水印方法做系统评估,覆盖 12 种攻击类型、3 个语言模型和 5 个数据集:SynthID 在未受攻击的原始文本上检测率 99.8%,中等程度改写攻击后降至 49.8%;仅需一轮 AI 改写工具处理,所有被测方案检测率都跌到 30% 以下。2026 年 7 月的一项实验性研究对包括 SynthID 在内 3 种主流方案进行 846 次改写攻击测试:SynthID 水印移除率超过 98%,另两种被 100% 全部移除;同时 SynthID 在人类写作文本上产生 5.4% 误报率,对 80% 的水印文本给出「不确定」结论。研究者最终结论是:目前 AI 水印无法满足司法采纳等特殊场景要求,也没有任何公开文本水印方案能作为法庭独立证据。
Anthropic 计划向第三方开放检测 API,但同时存在被滥用为「消除水印反馈信号」的隐患——使用者持续改写并调用 API 检查,逐步逼近水印完全清理。从效果看,那些认真修改润色 AI 初稿的人反而不太容易被检测到;体系真正有效打击的,是把 AI 结果原样复制粘贴、批量自动化发布的黑产者。
水印还有两个能力圈限制:一是生成过程需要足够概率空间,确定性回答(如「东方明珠在哪」)水印无介入余地;二是检测到水印不必然证明文章出自 AI——普通文章交给模型校对或翻译,输出同样可能形成水印。Anthropic 警告过:当检测器提示「这段内容经过 Claude 处理」,不能推断「这篇文章的思想来自 AI」。
技术脆弱性背后是商业空白。AI 水印市场 2026 年估值约 6–8 亿美元,年复合增长率约 25%。增长本质是法规执行力度与技术成熟速度的耦合。
四个方向值得注意: