桃子桃子快讯
返回首页
行业动态

书商怀疑 AI 公司收购珍本古籍并销毁以训练模型

Ars Technica 报道,书商怀疑 AI 公司大规模收购并销毁珍本古籍,用于模型训练。

2026.08.12 · 周三2 分钟阅读

Ars Technica 近日关注到,珍本与绝版书商群体怀疑部分 AI 公司正大规模购入稀有书籍,在高速扫描后将书页销毁,以获取用于训练大模型的高质量长篇文本。这一做法在藏书界引发了对文化遗产保护的广泛担忧。

AI 训练为何盯上「纸质书」

高质量的长篇文本是训练大语言模型的关键资源。相比互联网上碎片化的内容,一本完整的书籍在叙事连贯性、词汇丰富度和逻辑深度上都更具训练价值。AI 公司在模型迭代的竞赛中,对此类语料的需求持续增长,而实体书籍——尤其是那些已绝版、不再流通的作品——成为其重点收购对象。

书商观察到的可疑迹象

报道指出,部分书商注意到,一些买家会一次性购入大量二手甚至珍本书籍,并要求在极短时间内完成交付。处理流程上,这些书籍往往通过裁切书脊、将撕下的书页扫描后送入碎纸机的方式实现数字化,因为这是当前成本最低、速度最快的扫描手段。藏书界担心,此类行为的发生规模可能远超已公开报道的范围,并可能导致部分绝版实体书永久消失。

「本不必如此」

文章强调,这种破坏性的采集方式并非不可避免。非破坏性的专业扫描设备和数字化方案早已成熟,若 AI 公司愿意与图书馆、出版社等机构合作,通过合法授权的方式获取语料,完全可以在不损坏原书的前提下完成训练数据采集。书商和藏书爱好者呼吁行业转向更温和、合规的数据获取路径。

版权与伦理的灰色地带

围绕 AI 训练数据的版权争议由来已久,图书领域尤为突出。此事再次将焦点引向合理使用原则的边界、版权所有方的授权机制,以及文化遗产保护与商业模型迭代之间的张力。如何在推进 AI 能力的同时兼顾知识生产的源头伦理,正成为行业难以回避的议题。

信源