桃子桃子快讯
返回首页
行业动态

亚马逊被曝拆解绝版珍本扫描,用于训练大模型

亚马逊据报系统性收购绝版珍本图书并拆解扫描,以供大语言模型训练,应对高质量训练数据枯竭。

2026.08.18 · 周二2 分钟阅读

亚马逊被曝大规模收购绝版珍本图书,并在拆解书脊后逐页扫描,用于训练其大语言模型(LLM)。据 404 Media 报道,记者在一本珍本中放置了追踪设备,最终发现该书被送入亚马逊位于拉斯维加斯的一处数据处理设施。

代号 VGT3 的数据处理设施

这处设施对外标识为「VGT3」,其 logo 是一只爪子捧着一本书的恐龙图案。亚马逊在回应 404 Media 时表示,公司「通过商业渠道购买图书,以改善用户使用的产品和服务」。报道指出,亚马逊正系统性购入大量绝版图书,追踪设备显示这些书会被送至 VGT3 进行拆解和扫描,从而提取可用于 AI 训练的高质量文本。

为何绝版书成为「抢手数据」

大型科技公司训练 LLM 需要海量的文本数据,而互联网上的可获取文本基本已被各家大模型消化一空。此前 Anthropic 就曾因被指控使用盗版图书训练模型而陷入版权争议。绝版图书——尤其是已绝版或在互联网上找不到的数字孤本——因此成为新的重要数据来源。

这些文本的特殊价值在于:

  • 2022 年以前出版的内容不可能由 LLM 生成,从源头避免了 AI 生成文本污染训练数据的风险;
  • 当模型在训练中摄入过多 AI 生成内容时,会出现「模型坍塌」(model collapse),导致输出质量退化;
  • 绝版内容往往具备独特的人类写作风格与知识密度,是合成数据难以替代的。

争议与行业启示

亚马逊的做法再次把 AI 训练数据来源的伦理问题推到台前:

  • 绝版图书本身具有文化与收藏价值,拆解扫描意味着实体载体不可逆地损毁;
  • 即使通过「商业渠道」购得,未取得作者与权利人针对模型训练的明确授权,仍可能引发版权层面的争议;
  • 这反映出整个 AI 行业面临的结构性困境:高质量、可大规模获取的训练语料正在快速枯竭,企业不得不将目光投向越来越边缘的数据源。

目前亚马逊尚未公开其扫描绝版图书的具体规模、覆盖品类,以及这些数据被用于训练哪一款模型,相关做法在版权与文化遗产保护层面或将面临进一步审视。

信源