桃子桃子快讯
返回首页
行业动态

诉讼文件曝光:OpenAI、Microsoft 内部承认训练数据为「史无前例的窃取」

Mother Jones 诉 OpenAI 与 Microsoft 案法律文件披露两家公司高管私下陈述:承认抓取内容构成…

2026.09.23 · 周三3 分钟阅读

Mother Jones 杂志日前披露,其起诉 OpenAI 与 Microsoft 著作权侵权案的法庭文件中,出现了来自两家公司高管的内部陈述。这些材料显示,AI 行业内部早已意识到其训练数据获取方式具有极大争议,并对 AI 可能反过来摧毁内容生态有着清晰的预判。

诉讼背景

Mother Jones 早在两年前便联合其他出版方对 OpenAI 与 Microsoft 提起诉讼,指控两家公司在未经授权的情况下使用受版权保护的内容训练大模型。《纽约时报》、The Intercept 等多家出版方也发起了类似诉讼。9 月 4 日,原告方提交了一份长达 84 页的法律简报,其中援引了大量两家公司内部文件。原始文件目前仍处于密封状态,原告方正在请求法官予以公开。

高管内部表态

简报中披露的内部文件显示,Microsoft 应用科学总监 Brent Hecht 警告,AI 已形成一种「末日循环」(doom loop),将「威胁其核心供应商的经济根基」,并最终使互联网质量无限恶化。OpenAI 政策总监 Jack Clark 则写道,公司正在「创造替代社会文化定义者劳动的系统」。

更引人注目的是 OpenAI 总裁 Greg Brockman 与同事的通讯。文件中提到,Brockman 曾兴奋地展示 ChatGPT 在续写《纽约时报》文章段落方面的能力,并在同事告知「一个绕过《纽约时报》付费墙的技巧」后回复「啊,不错」。OpenAI 此前还托管过用户自制、专门用于绕过该报付费墙的 ChatGPT 工具。

数据冲击与「自我毁坏」

Microsoft 自身的研究表明,使用 AI 搜索时,用户对新闻文章的点击量比传统搜索下降约 90%。另一项分析显示,自 Google 推出 AI 概览以来,出版方从 Google 搜索与 Google Discover 获得的推荐流量至少下降了 30%。

内部文件同时显示,两家公司并非随机抓取数据。在某一版本的训练集中,新闻文章是最主要的内容类型,OpenAI 的目标被描述为「在现实新闻领域碾压时效性」。在构建数据集时,公司还系统性地剥离了版权声明、作者信息、使用条款等能够表明内容归属的元数据。Microsoft 的一份内部文件承认:「几乎所有这些内容都没有获得所有者的知情或同意。」

法律表态与行动落差

Microsoft CEO Satya Nadella 在证词中表示,公司不应「违反服务条款访问数据」;Microsoft 研究部门负责人 Glen Weyl 也认为,补偿创作者「符合雇主、国家和我所属许多群体的利益」。然而,前述内部文件揭示了实际行动与这些表态之间的明显落差。

值得注意的是,在诉讼发起后,OpenAI 迅速为其模型添加了专门的过滤器,避免输出正在起诉它的出版方的内容——这一举动从侧面印证了其训练数据中包含大量受版权保护内容的事实。

信源