AI公司扫描训练用书:所谓「珍本」并不稀有
评论文章指出,AI公司扫描销毁的书籍多为1970年后ISBN可查的普通出版物,并非所谓「珍本」。
近期多家AI公司被报道大规模扫描书籍用于模型训练,扫描对象限定为2002年前出版的内容以规避AI生成内容的法律风险。由于扫描过程具有破坏性,且规模庞大,此事引发舆论关注。Hackaday发表的一篇评论文章对相关报道中「珍本」(rare books)的说法提出了质疑,认为这一表述夸大了实际损失。
扫描过程为何要拆毁原书
文章作者曾在出版行业长期任职,对纸质与电子出版都有了解。他指出,AI公司拆解书脊、销毁原书至少出于两方面考虑。其一,从技术操作看,散页文件的数字化远比成册书籍简便,去掉装订是工序上的自然选择;其二,从版权角度看,购买原书后再将唯一实体销毁,可以主张仅存一份数字副本,从而在版权纠纷中占据有利位置。
「珍本」说法与实际情况的偏差
文章的核心反驳集中在「珍本」这一用词上。报道中描述的被扫描书籍几乎都通过ISBN订购,而ISBN国际标准书号体系直到1970年才建立。这意味着扫描对象不可能是中世纪手抄本或古籍善本,而主要是1970年之后出版、近半个世纪内的印刷品。
对于工业化时代大量印制的现代书籍而言,「稀有」与否取决于首印量与后续保存状况。许多1970年后出版的图书本身印量大、存世多且市场价值低,作者认为这些书在被销毁前几乎无人关注其存续。而真正稀有且有价值的近代出版物,通常已由图书馆或收藏机构妥善保存,不太可能流入大规模扫描的采购渠道。
出版业本身就在大量销毁书籍
文章进一步指出,公众对AI公司销毁书籍的愤怒,与对出版行业自身销毁未售出新书的冷漠形成了鲜明对比。出版业每年都会将大量未售出的全新书籍送入造纸回收链条,这一规模远超AI扫描项目。作者反问道:如果真的珍视旧书,那对出版业长年销毁图书的行为为何不见同等程度的抗议?
结语
文章承认AI公司有许多值得批评之处,但在诸多争议中,「破坏性地数字化书籍」相对而言并不算最严重的一项。作者呼吁公众把注意力放在AI公司更不愿意回答的问题上,例如训练数据的来源构成、版权合规细节以及模型对社会的影响等更具实质性的议题。
(注:本文为Hackaday发表的评论文章,原文以作者个人观点为主,对相关事件的描述基于公开报道与行业经验,并非AI公司或出版方的一手声明。)
