调查:LLaMA 等大模型用约 17 万本盗版书训练
The Atlantic 调查发现,用于训练 Meta LLaMA 等模型的 Books3 数据集含约 17 万本盗版书…
2023 年 9 月,《大西洋月刊》发布的一项调查显示,用于训练 Meta 开源大模型 LLaMA 的 Books3 数据集包含约 17 万本盗版书籍,其中不乏 Sarah Silverman、Richard Kadrey、Christopher Golden、Michael Pollan、Rebecca Solnit、Jon Krakauer、James Patterson、Stephen King、Zadie Smith、Junot Díaz 等知名作家的作品。这项调查首次以可验证的方式证实了这些作家的版权诉讼核心指控。
调查背景:被忽视的「训练数据黑箱」
生成式 AI 的训练数据来源长期不透明。ChatGPT 等模型依赖海量文本,但外界极少能确知具体使用了哪些书籍。原告作家 Sarah Silverman、Richard Kadrey、Christopher Golden 此前在加州起诉 Meta,指控其未经授权使用其作品训练 LLaMA。然而,诉讼材料与公开评论均未提供数据层面的直接证据。
本调查基于一个称为 Books3 的数据集,它是 EleutherAI 创建的大规模训练语料库「the Pile」的组成部分。Books3 此前曾在 GitHub、Hugging Face 等开发者社区流传,最终托管于 The-Eye.eu,直到该站点收到丹麦反盗版组织的下架通知。
数据分析方法
由于 Books3 体量过大,无法用普通文本编辑器打开,记者编写程序从 the Pile 中提取所有标记为「Books3」的行。原始数据中每条记录仅含「text」字段,没有标题、作者或元数据。记者随后编写脚本提取每本书的 ISBN,再通过在线图书数据库批量比对,最终识别出约 19 万条记录,其中超过 17 万本可确认书名与作者。剩余约 2 万本因缺失 ISBN 或未被数据库收录而无法识别。
主要发现
- 规模:约 17 万本可识别书籍,多数为过去 20 年内出版。
- 类型分布:约三分之一为虚构类,三分之二为非虚构。
- 主要出版社:
- 企鹅兰登书屋及其子品牌:超过 3 万本
- HarperCollins:约 1.4 万本
- Macmillan:约 7000 本
- 牛津大学出版社:约 1800 本
- Verso:约 600 本
- 代表作家:包括 Elena Ferrante、Rachel Cusk、Haruki Murakami(至少 9 本)、Jennifer Egan(5 本)、Jonathan Franzen(7 本)等。
涉事厂商回应
- Meta:发言人拒绝置评。
- Bloomberg:确认 Books3 曾用于训练初代 BloombergGPT,并表示未来版本将不再使用该数据集。
- EleutherAI:执行董事 Stella Biderman 未否认 GPT-J 训练中使用了 Books3。
调查指出,the Pile 的来源还包括 YouTube 视频字幕、欧洲议会文件及记录、英文维基百科、安然公司倒闭前的员工邮件等,反映出生成式 AI 对文本规模而非题材的依赖性。这项调查为正在进行的 AI 训练数据版权争议提供了关键事实依据。
