Anthropic 因盗版训练数据达成 15 亿美元和解协议

Anthropic 因盗版训练数据达成 15 亿美元和解协议

Anthropic 已达成一项 15 亿美元的和解协议,以解决其使用盗版书籍训练其 Claude 大语言模型 (LLM) 的指控。此次和解凸显了一个关键的法律区别:虽然在受版权保护的文本上训练 AI 模型可能被视为合理使用,但通过盗版渠道获取这些数据的行为并不属于合理使用。

和解条款与赔偿

这项 15 亿美元的解决方案为受影响的作者和出版商提供了经济补偿,尽管在集体诉讼代表和普通集体成员之间的资金分配存在显著差异。

  • 按书名赔偿: 合格的书籍将每本获得约 3,000 美元。在传统的出版合同中,该金额通常由作者和出版商平分。
  • 集体诉讼代表补偿: 三名集体诉讼代表预计每人将获得 15,000 美元。
  • 法律费用: 主审法官将集体诉讼律师请求的费用减半,从 12.5% ($187.5 million) 降至 6.8% ($101 million)。未报销的诉讼费用总计 260 万美元。

法律先例:盗版 vs. 合理使用

本案的一个关键要素是法院对 AI 训练性质的司法判定。Alsup 法官此前发布了一项命令,指出虽然 Anthropic 在获取书籍的过程中涉及盗版行为而需承担责任,但随后在这些书籍上训练 LLM 的行为构成了合理使用。

这种区别表明,AI 公司的法律风险可能较少在于“学习”过程本身,而更多在于所使用数据集的来源。此次和解的核心问题不在于使用书籍进行训练,而在于这些书籍是盗版的。

行业与社区反应

此次和解在法律专家和创意社区之间引发了关于处罚力度是否充分以及对 AI 行业影响的重大辩论。

对和解金额的批评

许多观察人士认为,15 亿美元这一数字虽然看似庞大,但代表的是一种“经营成本”而非威慑力。批评者指出,联邦版权法规定,商业性版权侵权可能导致监禁和巨额罚款,因此认为民事和解是一个宽大的结果。

"This is not even than a slap on the wrist. Publishers who negotiated this really fucked up writers. According to US federal law, pirating a single copyrighted work and gaining commercial advantage of it... represents five years in prison and a $250,000 fine."

支持开放获取的观点

相反,一些人认为,当前的版权系统是一种人为的垄断,阻碍了信息的有效流动。从这个角度来看,在现有知识上训练 AI 被视为信息获取方式的一种必要演进,重点应该放在保护私人个人数据,而不是受商业交易的作品上。

对其他模型的启示

此次和解引发了关于其他 AI 开发商,特别是那些创建“开放”模型的开发商的问题。如果 Anthropic 使用的数据集在行业内是通用的,那么其他模型开发商也可能在训练数据的来源问题上面临类似的法律挑战。

Sources