16 家主流新闻机构屏蔽 AI 爬虫,事实核查工具反而更不可靠
开发者实测发现路透、华尔街日报、纽约时报等 16 家以事实核查著称的主流媒体拒绝 AI 爬虫访问,导致模型只能依赖 SE…
一名维护开源事实核查工具的开发者近日公布了一组实测数据:在 2026 年 7 月 30 日对约 47 个域名进行的连通性测试中,包括路透社、美联社、华尔街日报、金融时报、纽约时报、卫报、经济学人、大西洋月刊、纽约客、政客杂志、Wired、The Verge、Ars Technica、BBC、Business Insider、ZDNet 在内的 16 家在新闻界以事实核查声誉著称的机构,全部对 AI 爬虫返回 400 错误,拒绝访问。
与之形成对照的是:政府类站点(SEC、FTC、DoJ、NASA、NIH 等)、世卫组织、欧盟与英国政府官网、Nature、Science、ScienceDirect、arXiv、PubMed 等学术站点,以及 Snopes、PolitiFact、FactCheck.org、Full Fact 等专业核查机构,均可正常抓取。Wikipedia、华盛顿邮报、NPR、Bloomberg、CNBC、Forbes、ProPublica、TechCrunch、404 Media 等也在可达列表之中。
被「掏空」的恰好是那些拥有专业更正团队、综合新闻报道能力的中坚媒体——而这恰恰是人们在使用 AI 时口头要求模型「优先采纳」的来源层级。
没有权威来源时,模型只能捡最不坏的 SEO 博客
作者原本设计了一组对照实验:同一份报告运行两次,一次给模型附加「使用可信来源」的指令,一次不给,比对结论差异。但基线运行就已经偏离了预期——一份涉及商业建议视频的核查任务中,模型检索到的「权威新闻来源」数量为零。取而代之的是 SEO 联盟博客、厂商内容营销稿、付费新闻通稿站、股票论坛和 AI 生成的 Wiki。当核查对象涉及视频主讲人自身的营收数字时,模型找到的唯一来源是此人自己的播客和网站。
在这样的候选集里,被要求「倾向可信来源」的模型只会做力所能及的事:挑出最不糟糕的那篇 SEO 博客。
比「缺失」更糟的,是「二次过水」
作者预想被屏蔽的内容只是「缺席」,实测却发现它们仍然出现在结果中,只是失去了原始归属。一条关于某创业公司用户数的声明中,Wired 与 Business Insider 的报道数字均被引用,但来源指向的是某聚合站,而非原始报道;旁边还并列着公司自称「被 Forbes、Wired、Futurism 等 30+ 媒体报道」的自我宣传。
对朴素的「独立来源计数」逻辑而言,这看起来像多条独立佐证;实际上却是一家编辑部的工作披上了一件聚合站的 URL,而原文被屏蔽机制本身挡住了,无法回溯。屏蔽没有把报道从管线里移走,而是移走了归属,把剩余部分「洗」成了看似多源的样子。
这比「AI 容易出错」更具体:它输出的是一份措辞自信、引文齐整、看上去有据可查的结论,背后的引用图已经悄悄塌缩成了一个节点。
同一查询、同一下午,结果可以完全不同
实验还顺带暴露了搜索层本身的剧烈抖动。作者准备的对照组要求同一条查询在一分钟内重跑两次以观察自然波动,结果同一查询返回的九篇域名仅有一个重合,且第二次运行出现了第一次没有返回的 Wikipedia——质量层级也随之中断。
更严重的是,第二次运行丢失了原核查结论所依赖的那条证据:第一次能查到两家对冲基金的对比事实,第二次模型自己写道「搜索结果中没有比较 D.E. Shaw 与 Two Sigma 的信息」。同一条工具、同一个问题、同一个下午,一次能支撑结论、一次无法触达结论。而另一条查询在两次运行中返回了字节级一致的结果,说明这种噪声并非均匀背景,无法简单扣除,它按查询粒度分布且不可预测。
这也意味着,原本的「加指令 vs 不加指令」对照实验从设计上就无法成立:任何差异都无法与上述噪声区分开。
对工具建设者的提示
需要说明的是,这只是单个爬虫(Anthropic 的 user agent)在单日的行为样本,结论不应外推到所有搜索引擎与所有 AI 服务商。但对正在搭建基于开放网络的事实核查或 RAG 系统的团队而言,这一组实测至少给出三点警示:
- 单纯告诉模型「使用可信来源」并不解决问题,可信来源本身可能根本不在候选集里。
- 二手转载并不能视为独立佐证,原文归属缺失时需要降权或显式标注。
- 检索层抖动是不可忽视的工程变量,关键结论应多次采样、跨来源交叉验证,并设计对单点失效的兜底。
屏蔽 AI 爬虫在版权与商业谈判背景下有其合理性,但它对通用搜索型核查工具带来的结构性后果,此前鲜见系统性记录——这正是这篇实测最值得被记住的地方。
