桃子桃子快讯
返回首页
行业动态

15亿美元和解背后:AI训练与盗版语料的法律分界

美国法院批准Anthropic与作者群体达成的15亿美元版权和解,厘清训练用途与语料取得的法律边界。

2026.07.21 · 周二4 分钟阅读

当地时间 7 月 20 日,美国旧金山联邦法院最终批准 Anthropic 与作者群体达成的 15 亿美元版权和解。这是目前已知美国版权案件中金额最高的一笔和解。按照和解方案,相关款项将用于补偿约 50 万部作品的权利人,平均每部作品对应约 3000 美元。超过 91% 的相关作者和出版商已经提出补偿请求,法院同时批准支付超过 1.01 亿美元的律师费。

法院区分了「训练」与「语料取得」

本案审理中,法院实际上作出了两项方向并不完全相同的判断。一方面,法院认为 Anthropic 使用图书训练大语言模型具有较强的转换性,在本案具体事实和证据条件下,可以构成美国版权法上的合理使用。模型通过阅读大量作品学习语言规律,并不当然等于对作品表达的复制和替代,至少在这份裁判中,法院没有接受「未经许可使用版权作品训练模型必然构成侵权」的主张。

另一方面,法院认定 Anthropic 为建立可反复使用的「中央图书馆」,从盗版网站下载并保存超过 700 万本图书,这些复制行为不能仅因将来可能用于 AI 训练,就自动获得合理使用保护。训练目的与语料来源是两个不同的问题:AI 训练可能具有转换性,并不意味着企业可以通过任何方式取得训练材料;最终用途可能合法,也不能倒推前端盗版下载和复制行为合法。

和解而非判例:15亿美元的真实含义

如果把 Anthropic 的行为拆开看,整个案件至少包含四个不同环节:从盗版网站批量下载图书;将图书复制并存入企业「中央图书馆」;从图书库中调取部分作品训练模型;训练完成后生成新内容。版权法不会因为这些行为服务于同一项技术活动,就将它们视为不可分割的整体。

取得语料涉及复制是否合法;保存语料涉及复制目的、期限和必要性;训练模型涉及转换性使用及其对原作品市场的影响;生成内容则可能涉及表达相似、实质性替代以及输出端侵权。Anthropic 在训练环节获得有利判断,却在语料取得和保存环节面临巨大风险,双方最终达成和解正是因为后一环节可能带来的法定赔偿责任极为惊人。

需要注意的是,15 亿美元是和解而非法院判决。Anthropic 借此避免了案件继续进入审判,也没有承认所有相关 AI 训练行为均构成侵权。对于选择退出和解的作者、出版商,仍可能针对 Anthropic 另行提起诉讼。此前关于训练行为构成合理使用的判断,也只是本案特定事实基础上的地区法院裁判,并未为美国所有生成式 AI 案件建立普遍适用规则。

对AI企业的合规启示

Anthropic 案表明,过去许多企业评估训练数据风险时首先追问的「使用作品训练模型是否构成合理使用」这个问题问得太早了。在判断训练用途之前,企业至少还要回答:

  • 数据从哪里获得?下载平台是否具有合法授权?
  • 获取过程中是否绕过技术措施?
  • 企业保存了多少份副本?训练完成后原始数据是否继续留存?
  • 谁曾经接触、复制和调用过这些数据?
  • 发生争议时,企业能否证明每一批数据的来源?

AI 版权合规因此不能只有一份「禁止使用数据清单」,而需要形成贯穿数据全生命周期的证据链:来源可追溯、权利可核验、用途可区分、存储可控制、删除可证明。采购第三方数据集的企业,不能仅依赖供应商「数据可用于 AI 训练」的承诺,合同还应明确数据来源、授权范围、转授权能力、侵权赔偿、审计权以及问题数据的删除义务。使用开源语料库的企业也要明确,「公开可下载」并不等于「版权已清洁」,开源的是数据集访问方式,不是其所含作品的版权。

对于已积累大量历史训练数据的企业,更现实的工作是尽快完成语料资产盘点,将合法购买、获得许可、公开授权、网络抓取和来源不明的数据分别标识,并对高风险数据采取隔离、替换或删除措施。

真正的分界线

15 亿美元不是对所有 AI 训练行为开出的一张统一价目表,它更像是一张迟到的账单:当训练语料的来源无法解释时,企业最终需要支付的,可能不是许可费,而是对整个数据取得方式的清算。技术目的的转换性,可能为模型训练提供合理使用空间,但再先进的理由,也不能成为盗版下载和无限期保存版权作品的通行证。这不是 AI 版权争议的终局,而是版权风险开始从笼统的「能不能训练」,转向对数据全生命周期逐层审查的起点。

信源