调查曝光亚马逊为训 AI 批量买书后销毁原件
404 Media 通过 AirTag 追踪发现,亚马逊批量采购纸质书后切断书脊扫描以训练 Nova 模型,Anthro…
科技媒体 404 Media 的一项调查显示,亚马逊正在大规模采购纸质书籍,扫描其内容用于 AI 模型训练,并在扫描过程中销毁了实体原件。调查人员将一枚 Apple AirTag 藏入一批稀有书籍的包裹中,一路追踪其去向,揭开了这条隐秘链路。
拉斯维加斯仓库里的「霸王龙团队」
AirTag 的最终定位指向亚马逊位于拉斯维加斯的一处仓库,这里驻扎着一支名为 VGT3 的团队,其标识是一只霸王龙手持一本书。据仓库工人透露,为了提高扫描效率,工作人员会直接切下书脊,再将散开的书页送入扫描设备。这意味着每一本被处理的实体书都再也无法复原。
扫描所得的文本数据被用于训练亚马逊自家的 Nova 系列基础模型。亚马逊发言人回应称,公司通过「商业渠道」购入这些书籍,目的是为了改进产品。
为什么印刷书对 AI 格外珍贵
书商和分析人士指出,AI 公司很可能正按 ISBN 编号系统性地扫描几乎每一本在售图书。印刷书之所以被视为高价值训练语料,原因有两个:
- 许多绝版或小众书目的内容从未被数字化,长期游离于公开网络之外;
- 出版时间大多早于 2022 年,几乎不含 AI 生成内容,语料「纯净度」高。
亚马逊并非孤例:Anthropic 的「巴拿马计划」
类似的操作并非亚马逊独有。此前一起由图书作者提起的诉讼披露,Anthropic 曾执行代号为「Project Panama(巴拿马计划)」的项目:在二手市场上购入大量纸质书,同样采取切断书脊后扫描的方式完成数字化。案件审理中,法官裁定该扫描行为属于合理使用,并未侵犯版权——理由之一是印刷原件已被销毁,不存在「扫描后再转售复制件」的情形。
公共知识被「锁进」私有模型
两起事件共同指向一个争议焦点:AI 公司将部分不可替代的纸质书变成了仅供自家模型使用的私有训练数据。批评者认为,这种做法将原本摆在公共书架上的知识抽离出来,封闭在单一商业公司的封闭模型之中,且原件已永久消失,社会公众既无法再接触到这些书,也无法追溯其内容是否被准确使用。
随着大模型对高质量训练数据的需求持续攀升,围绕「数据来源合法性」「合理使用边界」以及「文化资源公共性」的讨论,预计将在未来一段时间持续发酵。
