桃子桃子快讯
返回首页
行业动态

AI 公司抢购 2022 年前旧书:纯净数据与版权博弈

ISBNdb 等服务商向 AI 公司批量兜售 2022 年前印刷书作为「无 AI 污染」的训练数据,伴随版权诉讼与销毁争…

2026.07.22 · 周三4 分钟阅读

AI 公司正把目光从互联网转向书架。书业服务商 ISBNdb 正在向 AI 实验室批量出售 2022 年前出版的印刷书,理由很直接:这些书「结构性地」不含 AI 生成内容,是规避「模型退化(model collapse)」的理想训练语料。这一交易背后,牵涉 Anthropic、谷歌等公司此前的版权诉讼,以及稀有书源被销毁的伦理争议。

为何瞄准 2022 年前的印刷书

ISBNdb 在其网站上写道:「全球最优质的 AI 训练数据就摆在书架上。」该公司自称拥有「全球最大的图书数据库」,同时为 AI 公司提供大批量图书采购服务。其核心卖点是:印刷书出版于大模型时代之前,因而在结构上就免于 AI 生成文本的污染。

「2022 年前的印刷书在结构上保证了没有这种污染,仅此一点就是显著优势,」ISBNdb 在文章中写道。文章同时指出,互联网上的大量抓取数据很可能已混入 AI 生成文本,可能导致模型退化——即用 AI 生成数据训练的模型会变得更差、更易出错;而对训练持反对态度的作者,如今也可以通过「投毒」文本反向操纵模型行为。

批量采购:每笔 1 千到 100 万册

ISBNdb 原本服务于书商、图书馆和分销商进行库存管理。生成式 AI 浪潮兴起后,其图书元数据和批量采购撮合服务对 AI 公司产生了新价值。该公司可帮助 AI 实验室单笔采购 1,000 至 100 万册印刷书,并协助系统性获取、扫描、转化为训练数据,同时避免重复。

ISBNdb 还强调为 AI 公司身份保密:「每项合作都签署具有法律约束力的 NDA,客户的身份、策略和采购目标绝不会披露。」其网站同时承认「舆论问题真实存在」——「『AI 公司销毁两百万本书』这样的标题不会带来同情。」

版权诉讼与销毁争议

AI 公司大规模收购印刷书的行为在今年 1 月进入公众视野。当时书作者对 Anthropic 提起的版权诉讼披露了内部文件,显示 Anthropic 计划获取并扫描数百万册印刷书,并在过程中销毁原书。谷歌近期也被图书出版商起诉,理由是其 Gemini 模型同样涉嫌在受版权保护的图书上训练。

一位专门在二手平台上销售外文书的书商透露:自今年 4 月起,他与同行观察到「历史性的销售激增」。往常行情好的时候,他一周大约卖出 20 本书;4 月之后,他每周稳定售出数百本。他怀疑这些买家是 AI 公司,理由包括:

  • 他销售的图书通常面向学校与图书馆,而这些机构的采购近年因预算缩减持续下滑;
  • 这批大额订单涵盖的图书之间几乎没有主题共性,唯一的共同点是有 ISBN;
  • 他同时出售的无 ISBN 稀有书未被纳入这些批量采购;
  • 买家对价格「完全不在意」,部分明显高定价的图书也被照单全收,「这是 AI 公司的特征,他们钱太多了」。

该书商表示,他对自己经手的数百本书最终去向感到矛盾:一方面这些收入帮他清理了长期滞销的海外与外文库存,另一方面他不喜欢这些书的最终用途,也不愿见到稀有书目在扫描过程中被化浆销毁。

数据焦虑下的产业链重构

AI 公司对高质量、洁净训练数据的渴求,正在重塑传统书业的中下游链路。从 ISBNdb 这类撮合方,到 Better World Books 等面向 C 端的二手书回收平台,再到外文稀有书的独立书商,整条供应链都在承接来自 AI 实验室的批量订单。

与此同时,「模型退化」的隐忧与版权诉讼的阴影,使印刷书——这一古老的信息载体——意外成为大模型时代的稀缺资源。书商的库存清理收入与稀有书的物理消亡,正在同一笔交易中并存。

信源