牛津博德利图书馆文本被用于训练 OpenAI 模型
牛津大学允许 OpenAI 将博德利图书馆历史文本用于模型训练,原始公告仅提数字化未披露训练用途。
牛津大学已允许 ChatGPT 背后的公司使用其博德利图书馆(Bodleian Library)的历史文本来训练 AI 模型。根据内部文件,被 OpenAI 数字化的博德利馆藏材料已被用于「填充 OpenAI 训练集」。这一用途在双方 2025 年 3 月公开宣布的合作伙伴关系中并未提及,当时仅称将使用 OpenAI 软件对馆藏文本进行数字化,使内容更便于学生和研究人员访问。
合作规模与具体内容
截至 2025 年 6 月,博德利馆藏中已有 12.5 万张历史论文扫描图像分享给 OpenAI,涵盖 19 至 20 世纪欧美大学的博士论文。其他被扫描的文本还包括:
- 一批罕见的 16 世纪「单面印刷歌谣」(broadside ballads),共 1 万件,含歌词与乐谱,曾在都铎王朝街头流传;
- 18 世纪爱尔兰国家档案;
- 爱尔兰小说家玛丽·艾奇沃斯(Marie Edgeworth)的私人书信;
- 多萝西·霍奇金(Dorothy Hodgkin)的青霉素研究笔记。
合同还为后续更大规模数字化留出空间——博德利馆藏总量达 2300 万件。会议纪要还讨论了开发一款名为「Ask the Bod」的聊天机器人。
内部担忧与外界关注
通过信息公开请求获得的会议纪要显示,博德利治理委员会成员在内的教职工对与 OpenAI 合作表示担忧,主要顾虑包括:
- 合作的声誉风险;
- AI 训练属高能耗技术,与大学环保承诺存在冲突。
旧书商方面则报告称,近期出现大量冷门书目订单,例如《18 世纪非洲农具指南》《1950 年代汽车司机传记》等。旧书店主推测,由于这些书籍在网上没有数字化版本,它们可能成为下一代 AI 模型的新鲜训练数据。随着网络爬取内容中 AI 生成材料日益饱和,开发者开始转向实体历史书籍作为数据来源。
同类合作与行业对比
OpenAI 已通过名为 NextGenAI 的项目与美国波士顿公共图书馆、加州理工学院、麻省理工学院、密歇根大学等机构达成类似协议,牛津是该项目中唯一的英国成员。
相比之下,OpenAI 的主要竞争对手 Anthropic 被报道花费数千万美元购买图书并切下书脊进行扫描,随后将书销毁。Anthropic 表示不会购买和销毁珍本或古旧书籍。科技媒体 404 Media 还在一批二手书订单中放入追踪器,发现这些书最终被运至美国一处亚马逊设施,同样被拆解扫描。
双方回应
OpenAI 发言人表示,公司「很自豪」能「确保当今的 AI 模型为未来保存世界的历史知识」,并强调有超过 10 亿人在日常使用相关技术,让模型反映多元文化、历史和视角非常重要。
牛津大学发言人称,被数字化的文本规模「适中」,且均为已不在版权保护期内的材料;博德利图书馆保留扫描件权利,将在数月内开始在线公开发布,与其他数字化合作输出物处理方式一致。校方否认对公众和学生隐瞒机器学习相关用途,强调数字化是主要目的,但工作人员此前已公开说明该项目也会产出训练数据。博德利的实体馆藏在此合作下保持完整,与其他地方二手书被收购后销毁的情况不同。
