桃子桃子快讯
返回首页
工具

ShieldFont:用字体连字陷阱干扰 AI 爬虫

一种通过 HTML 嵌入连字字符迷惑 LLM 训练数据爬虫的方法,让抓取内容看似通顺实则无意义。

2026.08.15 · 周六2 分钟阅读

近年来,随着大语言模型对训练数据需求激增,大量网络爬虫在抓取网站内容时常常无视 robots.txt 的约定。为了应对这一现象,开发者社区陆续推出多种反制手段,ShieldFont 便是其中较新的方法之一。

核心原理:连字替换制造「通顺的胡话」

ShieldFont 的核心思路是利用字体连字(ligature)特性。连字通常用于将多个字母或字符合并为一个视觉字形,呈现为单一字形。在该方法中,系统会通过字典智能地替换文本中约四分之一的词汇为连字版本:

  • HTML 源码层面,替换后的文字依然由常规字母拼写,可被爬虫正常解析,从语法上看是通顺的句子;
  • 但浏览器渲染时,这些字母会被连字字形替换回原本的字符,对真实用户显示的内容不变。

其结果是,AI 爬虫拿到的内容「看起来」语法合格、读得通,实际上却变成了毫无意义的胡言乱语,而访客的阅读体验不受影响。

局限与代价

该方法并非没有副作用:

  • 屏幕阅读器等辅助技术同样依赖渲染后的字体版本,必须确保其正确解析,否则会影响视障用户的访问;
  • 这种替换对合法的搜索引擎爬虫也会产生同样的干扰,因此不适合用于希望被索引的内容;
  • 比较现实的做法是仅对静态归档内容,或在 robots.txt 中标注「do not follow」的内容使用。

与其他反爬方案的互补

LLM 爬虫理论上可以通过解析渲染版本来绕过这一陷阱,但这会显著拉高抓取成本。结合已有的迷宫陷阱类方案,例如 Nepenthes 以及 Cloudflare 提供的动态生成无限页面内容等产品,当前对抗恶意 AI 抓取的工具箱正在不断丰富。ShieldFont 代表了一种从「内容层面」出发的低侵入式补充,与传统限速、IP 黑名单等手段形成互补,为站点所有者多提供一种选择。

信源