皮尤研究:ChatGPT 发布后超三分之一网页有 AI 写作痕迹
皮尤研究中心最新研究显示,ChatGPT 发布后新发布的网页中,约 35% 存在 AI 写作或大量编辑痕迹,.com 域…
皮尤研究中心(Pew Research)发布的一项最新研究指出,自 OpenAI 在 2022 年 11 月推出 ChatGPT 以来,新发布的网页中有超过三分之一呈现出 AI 创作或被 AI「大幅编辑」的迹象。该结论与近期多项关于「机器内容占比迅速上升」的研究相互印证,也呼应了互联网基础设施服务商 Cloudflare 此前发布的报告——后者指出机器人流量已超过人类流量,拐点比预期更早到来。皮尤的关注点则从「谁在浏览」转向「谁在写作」:如今大量网页正在被 AI 生成,供其他 AI 或机器人阅读。
研究方法与样本
皮尤的研究团队基于 Common Crawl 网页归档,收集了过去五年左右的近 50 万个英文网页,时间跨度从 ChatGPT 发布前数年延伸至近期。随后,团队采用 AI 文本检测服务商 Pangram 的技术,对其中疑似由 AI 创作或大幅修改的内容进行识别。
在 2026 年 7 月采集的 1 万个随机网页样本中,约 10% 显示出「显著的 AI 创作痕迹」。但皮尤同时指出,随机抽样必然混入早期网页,因而会低估 AI 写作的实际占比。
过滤老网页后的核心发现
为更准确反映当下网页生态,皮尤将样本中早于 ChatGPT 发布的网页剔除,仅保留此后发布的内容。结果显示:
- 在过滤后的快照中,存在 AI 创作痕迹的网页比例升至 35% 以上。
- 区分顶级域名后,差异极为悬殊:.com 域名网页的 AI 创作比例约为 .edu 和 .gov 域名的 10 倍,后两者均仅约 1%。
- .org 域名网页的 AI 创作比例为 4.6%,介于以上两者之间。
这意味着商业属性越强的域名,AI 写作渗透率越高;而学术与政府类官方网站受 AI 写作冲击相对有限。
检测局限与语言特征变化
皮尤坦承分析并非完美:包括 Pangram 在内的 AI 检测工具存在误判可能,将非 AI 内容错判为 AI 内容的情况无法完全避免。但在数十万级样本的规模上,数据的方向性结论仍具有参考意义。
研究还附带观察到一个语言层面的变化——一些过去被认为「AI 味浓」的语言标记,例如破折号(em dash)、牛津逗号以及「这不是 X,而是 Y」一类句式,在近年网页中的出现频率也在持续上升。这与 AI 生成内容在网络中的扩张趋势相吻合。
对内容生态的启示
该研究从实证角度量化了生成式 AI 对公开网络内容的影响:商业站点首当其冲,而权威类域名受冲击较小。对搜索引擎优化、内容审核、信息可信度评估等领域而言,这意味着 AI 内容洪流已构成需要正面回应的系统性变量。
