AI 爬虫伪造来源链接 伪装成正常推荐流量
独立博主发现 AI 爬虫通过追加伪造查询参数,伪装成来自知名网站的推荐访问,以躲避网站分析工具的识别。
独立博客作者近期发现,AI 爬虫在抓取网站时采用了一种隐蔽手段:通过在目标 URL 后追加伪造的查询参数,让自己在网站分析工具中看起来像是来自其他知名网站的正常推荐流量。这一现象引发了关于爬虫识别与网站流量可信度的讨论。
异常流量的具体表现
据作者描述,过去一个月内,他在分析后台频繁看到形如 https://disassociated.com/?ref=yourwebsitepage/213page/page/page/14page/16page/page/2page… 的访问记录。这些被引用的来源网站通常是曾经链接过他博客的知名站点或博客,但分析工具无法识别出真正的来源页面,访问频率也与这些网站的真实读者量明显不匹配——按正常情况,不可能有成千上万人同时点击进入他的博客。
与正常追踪参数的差异
作者对比了真实流量来源:邮件订阅链接通常使用 ?utm_source、?utm_content 等标准化 UTM 参数,且来源标识合理规范。但本次观察到的爬虫行为呈现两个明显异常——一是 URL 路径杂乱无意义,如 page/14page/16page/page/2page 这类排列,正规站点几乎不会使用这样的链接结构;二是被引用的网站绝大多数都不运营邮件订阅,「通过订阅推送流量」的说法难以成立。此外,爬虫似乎集中针对网站首页进行抓取,而非内容详情页,作者推测 AI 工具在首页即可完成所需的索引或数据采集工作。
拦截仍面临困难
目前作者尚无有效手段识别和屏蔽这些伪装的 AI 爬虫,只能在分析后台继续看到大量失真的访问记录。这一案例反映出,随着 AI 训练数据需求持续增长,爬虫与网站运营者之间的「攻防」正变得更加复杂。伪造来源链接这种新手法,会让网站流量统计的准确性进一步下降,也可能干扰运营者对真实用户行为的判断。
