AI 公司一边制造内容,一边避开 AI 内容:训练数据的悖论
AI 公司竞相收购 2022 年前出版的人类书籍,利用 Reddit 数据,同时担忧「模型崩溃」;研究显示,人参与其中的…
AI 行业正面临一个明显的悖论:模型厂商一边大规模生成 AI 内容,一边在训练阶段竭力回避 AI 生成的数据。404 Media 近期报道指出,多家 AI 公司正在批量采购「前 AI 时代」的出版物,用于模型训练,以降低「模型崩溃」风险。
书籍数据:ISBNdb 成为关键来源
报道中提到的一个重要数据供应商是 ISBNdb。该公司最初面向图书馆与书商提供图书元数据,随后业务转向数字化书籍,向 AI 公司出售训练语料。ISBNdb 自称是全球最大的图书数据库,收录约 1.11 亿册图书。其核心卖点在于:2022 年之前出版的图书基本不含 AI 生成内容,因此被视为「干净」的训练数据。
Reddit 数据同样被看重
除书籍外,AI 公司对 Reddit 数据表现出浓厚兴趣。原因有三:内容主要由人类撰写;话题覆盖广泛且持续更新;投票机制附带人类对信息质量的判断。这些特征使 Reddit 成为训练 AI 的优质语料。
「模型崩溃」:被反复训练的内容会退化
「模型崩溃」指 AI 模型在多代 AI 生成内容上训练后,输出准确性与质量持续下降的过程。具体表现为:罕见或独特的观点逐渐消失,输出趋于平庸和平均化,幻觉被反复「确认为真」并在后续回答中被强化。
人类参与的循环同样会导致趋同
传统讨论聚焦于纯 AI 内容的自我循环,但原作者提出一个更深层的问题:当信息源本身已被 AI 污染,即使有人类参与训练数据生成,「模型崩溃」依然会发生。流程大致是:使用 AI 辅助的作者产出内容 → 被收入训练集 → 训练后的模型再输出给作者 → 作者据此写出更趋同的作品 → 再次进入训练循环。已有研究观察到:AI 生成的故事创意能提升单个写作者的创造力,却让不同写作者之间的想法彼此趋同,导致整体内容池的同质化。
小结
AI 公司对训练数据的焦虑,折射出整个内容生态面临的结构性问题:AI 生成的内容正在回流到它自己的训练管线中。即便有人类作为中介,多轮迭代之后,独特性与多样性仍会被逐步侵蚀。这不仅关乎模型质量,也关乎整个知识生态的长期健康。
