AI 快讯索尼华纳联手起诉Anthropic
行业快讯

索尼华纳联手起诉Anthropic

2026-08-30T08:03:17.131Z
索尼华纳联手起诉Anthropic

索尼音乐出版与华纳查佩尔音乐起诉 Anthropic,指控其通过 BitTorrent、歌词网站等渠道获取数万部受版权保护的音乐作品,用于训练 Claude。按每部作品最高 15 万美元计算,潜在赔偿可能达到数十亿美元。

发生了什么

索尼音乐出版与华纳查佩尔音乐在美国加州北区联邦地区法院起诉 Anthropic 及其两位联合创始人,指控后者未经授权获取、复制并使用数万部受版权保护的音乐作品歌词、乐谱等资料训练 Claude 系列模型。

这起诉讼的关键不只是模型输出了什么,而是 Anthropic 被指控如何获得训练数据:原告称,该公司通过 BitTorrent 等渠道下载盗版资料,并从 MusixMatch、LyricFind 等歌词网站抓取内容,再将这些材料纳入 Claude 的训练流程。换句话说,案件焦点正在从“AI 训练版权内容是否属于合理使用”,转向“训练数据本身是否通过侵权方式取得”。

美国当地时间 2026 年 8 月 28 日,法院公示了相关起诉文件;8 月 29 日,Music Business Worldwide、TechCrunch、The Verge 等媒体披露了案件细节。今天是 8 月 30 日,这场诉讼已经成为继 Anthropic 与出版业达成 15 亿美元和解之后,针对这家 AI 公司新一轮、且覆盖音乐版权的重量级诉讼。

索尼音乐出版与华纳查佩尔音乐起诉 Anthropic 的新闻配图,画面可包含法院文件、Claude 标识与音乐版权符号

索赔金额为什么可能达到数十亿美元

法定赔偿是美国版权法允许版权方在侵权成立后,按照每部作品计算赔偿金额,而不必完全证明实际损失的制度。

索尼与华纳方面请求法院按照每部被侵权作品最高 15 万美元的标准判赔,并针对每一次被移除的版权管理信息,追加最高 2.5 万美元赔偿。若法院最终认定涉及“数万部”作品,且认可版权管理信息被批量删除,理论上的赔偿规模可能达到数十亿美元。

需要强调的是,最高赔偿额并不等于 Anthropic 已经需要支付的金额。案件仍处于起诉阶段,法院还需要判断:

  • 被指控的作品是否确实存在于 Anthropic 的训练数据或相关数据副本中;
  • Anthropic 是否直接实施了下载、复制、抓取或传播行为;
  • 这些行为是否由公司员工、承包商或其他数据供应链完成;
  • 涉及多少部具体音乐作品;
  • 版权管理信息是否被删除,以及删除行为发生了多少次;
  • 法院最终适用何种赔偿标准,是否按照最高法定额度计算。

| 诉讼项目 | 原告主张的最高金额 | 可能影响 | |---|---:|---| | 每部被侵权音乐作品 | 15 万美元 | 取决于法院认定的作品数量及侵权成立情况 | | 每次删除版权管理信息 | 2.5 万美元 | 取决于删除行为是否存在、次数如何计算 | | 潜在总赔偿 | 数十亿美元 | 只是按最高额度叠加后的理论规模 |

索尼音乐出版是全球最大的音乐出版公司之一,管理大量歌曲的词曲版权;华纳查佩尔音乐则是华纳音乐集团旗下的音乐出版机构,拥有超过 140 万首音乐作品和约 10 万名作曲家。两家公司联合起诉,意味着本案覆盖的作品范围和版权证据储备都不会太小。

真正的红线:盗版来源可能击穿合理使用辩护

合理使用是美国版权法中的一项抗辩原则,允许在特定条件下使用受版权保护的作品,例如评论、研究、教育或具有明显转化性质的创作,但它不是对所有 AI 训练行为的自动豁免。

在 AI 训练场景中,模型公司通常会强调,训练过程并非把一本书、一首歌或一段歌词原封不动地提供给用户,而是让模型学习语言规律、结构和关联关系,因此属于具有转化性质的使用。这一说法能否成立,要综合考察使用目的、作品性质、使用数量以及对原作品市场的影响等因素。

但本案最棘手的地方在于,原告并不需要把全部争议都押在“训练是否具有转化性”上。它们试图证明的是:Anthropic 先通过盗版渠道取得作品,再把这些作品用于模型训练。如果这一事实被法院认可,那么 Anthropic 将很难仅靠“模型学习的是模式,不是逐字复制内容”来解释最初的数据获取行为。

这条法律逻辑在 Anthropic 先前的出版业版权纠纷中已经受到关注。根据参考资料,Anthropic 此前与作者及出版业原告达成了 15 亿美元和解,争议同样涉及通过非法资料库获取受版权保护的书籍。相关案件释放出的行业信号是:使用合法取得的作品训练模型,与从盗版渠道批量下载作品,是两个不能混为一谈的问题。

| 争议层面 | AI 公司可能的辩护 | 版权方的反驳 | |---|---|---| | 模型是否复制原文 | 模型学习统计规律,不等于逐字复制 | 模型能够输出歌词片段,说明训练资料可能被记忆和复现 | | 训练是否具有转化性 | 训练用于生成全新的回答和内容 | 训练前提是未经许可复制完整作品 | | 数据是否影响市场 | 模型不是音乐流媒体或歌词平台 | Claude 可直接提供歌词,可能替代授权服务 | | 数据获取是否合法 | 数据来自公开网页或第三方集合 | 公开可访问不等于可以批量复制并用于商业训练 |

歌词不是“网上随便能看到的文本”

版权管理信息是附着在作品或数字文件上的权利人、作者、版权声明、识别编号等信息,用于标识作品归属并帮助平台执行授权、追踪和分发收益。

歌词之所以容易成为生成式 AI 训练争议的爆点,是因为它同时具有三种属性:内容短、结构稳定、用户需求强。对于模型来说,歌词是相对容易记忆和复现的文本;对于版权方来说,歌词又是可单独授权、可被搜索和展示、具有明确商业市场的作品。

如果用户让 Claude 补全某首热门歌曲的歌词,模型直接输出大段原文,那么版权方可以从模型行为中寻找记忆与复现的证据。即便模型平时主要用于问答、写作和编程,某些高频、短文本作品仍可能通过训练数据残留进入输出阶段。

更重要的是,索尼和华纳的诉状据称还涉及乐谱等资料。音乐出版商管理的并不只有录音版权,还包括词、曲、歌词、乐谱以及相关改编权。唱片公司通常拥有录音制品权,而音乐出版商更接近作品本身的词曲版权。这意味着本案可能不仅讨论“模型能不能生成一段像某位歌手的音乐”,也会处理歌词和作曲作品在训练数据中的复制与再现问题。

Anthropic 面临的不是一次普通版权诉讼

这起案件的压力,首先来自索赔基数的可扩展性。单个作品的争议金额可能看起来有限,但模型训练通常涉及数百万乃至数十亿条数据。一旦法院允许版权方按照作品数量逐项计算,数据规模就会把法律风险迅速放大。

其次,原告要求披露训练数据并销毁侵权副本,这比单纯支付赔偿更难处理。训练数据集、清洗后的语料、分词结果、检查点、缓存、备份文件和模型权重之间并不是一一对应的关系。公司即使可以删除原始文件,也未必能够证明某一部作品从训练流程和模型参数中被彻底清除。

模型权重是神经网络训练结束后保存的参数集合,它并不以传统文件目录的方式列出“包含哪些文章或歌词”。但这不代表训练数据的来源无法追踪。通过数据管线日志、下载记录、数据哈希、去重系统、标注文件、训练批次记录以及模型输出测试,原告可能尝试重建作品进入训练流程的路径。

这将把版权诉讼从单纯的内容比对,推进到企业数据治理和机器学习供应链审计层面。未来法院可能会关注的不只是某次输出是否侵权,还包括公司是否保存了足够的训练数据来源证明、是否建立了版权排除机制、是否在发现问题后及时清理相关数据。

对 AI 行业的影响:先证明数据合法,再谈模型能力

这起诉讼最现实的影响,是迫使 AI 公司把训练数据来源从内部工程问题,提升为商业合规问题。

过去,行业竞争更关注模型参数规模、上下文长度、推理速度和基准测试成绩。现在,数据来源可能直接决定一家公司的资产负债表和商业化节奏。一个模型即使在代码、数学或长文本任务上表现优秀,只要训练数据存在大规模非法获取证据,企业就可能面临高额和解、模型重训、数据披露以及产品限制。

对大型实验室而言,最可能出现的路线有三条:

  1. 建立授权数据池。 与出版商、音乐机构、新闻集团和专业数据库签署许可协议,明确可用于训练、微调、检索和模型输出的范围。
  2. 强化数据溯源系统。 为每批训练数据记录来源、抓取时间、授权状态、删除请求和处理结果,形成可供审计的证据链。
  3. 控制模型记忆与输出。 通过数据去重、敏感内容过滤、版权文本检测和拒答策略,降低模型直接复现歌词、书籍段落或新闻全文的概率。

对中小模型团队来说,问题更尖锐。大型公司可以通过采购授权数据和支付和解费用来消化风险,中小团队却可能承担不起一次按作品数量计算的诉讼。版权合规因此可能成为新的行业进入门槛,进一步推动模型开发从“尽可能多收集数据”,转向“只使用能够证明来源的数据”。

内容行业也会改变策略。过去,版权方更多通过网站反爬、数字水印和内容下架来保护作品;面对 AI 公司,它们会更关注训练数据披露、模型输出监测、集体授权和按使用量分成。音乐出版商拥有相对成熟的版权登记和授权体系,可能比个人作者更容易建立针对 AI 训练的收费标准。

这场官司决定不了所有问题,但会重新排列优先级

本案并不一定会直接给出“所有 AI 训练是否属于合理使用”的最终答案。美国版权诉讼通常会围绕具体作品、具体行为、具体证据展开,法院对 Anthropic 数据来源的判断,也未必自动适用于其他模型公司。

但它会强化一个已经越来越清晰的行业排序:数据获取是否合法,是讨论模型训练合理性的前提;模型是否具有转化性,是第二层问题;模型能否复现受保护内容,则是第三层风险。

如果索尼与华纳能够证明 Anthropic 曾系统性地通过盗版渠道获取歌词和乐谱,案件可能促成更大规模的授权谈判。AI 公司会更愿意为高价值数据支付许可费用,版权方则会要求更明确的训练范围、输出限制、审计权和收入分成。

如果 Anthropic 最终通过和解解决案件,金额仍可能成为行业定价的重要参照。15 亿美元的出版业和解已经说明,历史数据风险可以转化为极高的现金成本;这次音乐版权诉讼若达到数十亿美元级别,则会进一步证明,训练数据并不是“免费原材料”,而是一项需要采购、管理和持续维护的基础设施。

对开发者和深度用户而言,短期内最值得关注的不是 Claude 是否会立刻改变产品功能,而是三件事:Anthropic 是否回应具体盗版获取指控,法院是否要求披露训练数据,以及双方是否围绕音乐作品达成新的授权或和解安排。

我的判断是,这场诉讼对行业的冲击不会首先体现在模型性能上,而会体现在模型公司的成本结构和数据策略上。AI 仍然需要海量数据,但“先抓下来、再讨论版权”的路径正在快速失去可行性。未来真正有竞争力的模型公司,不仅要有更大的算力和更强的算法,也要能回答一个越来越具体的问题:这条训练数据,究竟从哪里来,凭什么可以用?

参考来源

  • IT之家:索尼音乐与华纳查佩尔起诉 Anthropic,指控其使用盗版歌词训练 Claude —— 汇总案件起诉时间、被告信息、涉案数据来源及潜在赔偿金额。

  • Music Business Worldwide:《Sony Music, Warner sue Anthropic, alleging a “brazen campaign” of intellectual property theft》—— 报道两家音乐出版商提出的核心指控及案件范围。

  • TechCrunch:《Sony Music, Warner sue Anthropic, alleging a “brazen campaign” of intellectual property theft》—— 关注案件涉及的非法下载、抓取和盗版数据获取问题。

  • The Verge:《Sony Music and Warner Chappell are suing Anthropic》—— 介绍每部作品最高 15 万美元、版权管理信息每次最高 2.5 万美元的索赔主张。

相关推荐

查看全部