YC 秋季四分之一新创公司主页对 AI 爬虫显示空白
ReadableByAI 指数显示,25.5% 的 YC Fall 2025 创业公司主页向 GPTBot 等爬虫返回空…
ReadableByAI 发布的最新「Readability by AI Index」显示,在 145 家 Y Combinator Fall 2025 入营创业公司中,有 25.5% 的官方主页向 GPTBot、ClaudeBot、PerplexityBot 等主流 AI 爬虫返回的只是空壳 HTML——除一个 <div id="root"> 外,几乎没有任何可被读取的正文。而作为对照组的 455 家成熟 SaaS 公司中,这一比例仅为 2.9%,两者之间存在 8.9 倍的差距。该指数测量时间为 2026 年 8 月 8 日。
测量方法与边界
Readability by AI Index 对每个主页发起两次抓取:一次使用基线浏览器 User-Agent,另一次分别使用 12 个爬虫 User-Agent(11 家 AI 厂商爬虫加 bingbot 作为非 AI 对照)。可见词数、渲染分类与 robots.txt 等数据均来自基线抓取,因此与身份无关——一个页面是用原始 HTML 输出内容,还是依赖客户端渲染,对任何访问者都是一致的。
报告主动排除了「访问」层面的数据——例如哪些爬虫拿到了 200、哪些被 403 拦截——理由是:来自数据中心 IP 的爬虫探针本身是未经验证的身份,厂商通过已发布的 IP 段来认证爬虫,因此外部探针无法分辨是真实拦截,还是 WAF 拒绝了冒名者。要得出结论必须依赖网站自己的服务器日志,而报告方并不掌握这些日志。
报告同时承认,外部探针无法排除「按 IP 段差异化返回内容」的可能性,但这种情况罕见,现有数据中没有迹象。
核心数据对比
- YC Fall 2025:145/147 返回 200。其中 CSR_SHELL(<150 可见词)占 25.5%(37 家),SSR_THIN(150–399 词)占 9.7%(14 家),SSR_FULL(≥400 词)占 64.8%(94 家)。可见词中位数 630,配置 robots.txt 的占 76.6%,提供 llms.txt 的占 33.1%。
- 成熟 SaaS:455/514 返回 200。CSR_SHELL 仅 2.9%(13 家),SSR_THIN 占 2.4%(11 家),SSR_FULL 高达 94.7%(431 家)。可见词中位数 1239,robots.txt 覆盖 98.0%,llms.txt 覆盖 54.3%。
一个 SaaS 主页的可读内容中位数大致是 YC 新创公司的两倍。值得注意的是,有 4 家成熟 SaaS 公司反向操作:识别出非浏览器请求后,向 AI 爬虫返回的字节量比基线浏览器抓取还要多——最大的一例是某薪酬平台,约 220 倍;另一例 ML-Ops 平台约 141 倍。这说明该问题已被部分团队有意识地解决,属于工程上可克服的障碍。
对创业公司的实际含义
报告未在公开版本中点名具体公司,但所有 145 家 YC Fall 2025 入营公司都被分配了稳定的匿名 ID(yc-001 至 yc-145),可在后续版本中跨期追踪。报告方表示,发布匿名版的目的不是「立名耻辱柱」,而是推动页面修复。报告同时承认,仅凭外部探针无法区分「真正拦截 AI 爬虫」与「WAF 拦截了冒名探针」,这一问题只能通过站点服务器日志与厂商发布的爬虫 IP 段交叉验证来解决。
报告还指出,未来将开发「双源探测」机制(同时从住宅网络和数据中心网络发起抓取),以暴露仅基于 IP 段的 Bot 管理策略,但该功能尚未实现,因此暂不出售。
