Anthropic 因盜版訓練數據達成 15 億美元和解協議

Anthropic 因盜版訓練數據達成 15 億美元和解協議

Anthropic 已達成 15 億美元的和解協議,以解決其使用盜版書籍訓練其 Claude 大型語言模型 (LLM) 的指控。此次和解凸顯了一個關鍵的法律區別:雖然在受版權保護的文本上訓練 AI 模型可能被視為合理使用,但透過盜版來源獲取該數據的行為則不然。

和解條款與賠償

這項 15 億美元的解決方案為受影響的作者和出版商提供了財務補償,儘管集體訴訟代表與一般集體成員之間的資金分配存在顯著差異。

  • 每部作品賠償: 合格的書名將各獲得約 3,000 美元。在傳統出版合約中,這筆金額通常由作者和出版商平分。
  • 集體訴訟代表補償: 三位集體訴訟代表預計每人將獲得 15,000 美元。
  • 法律費用: 主審法官將集體訴訟律師要求的費用減半,從 12.5% ($187.5 million) 降至 6.8% ($101 million)。未報銷的訴訟費用總計為 260 萬美元。

法律先例:盜版 vs. 合理使用

本案的一個關鍵要素是法院對 AI 訓練性質的司法判定。Alsup 法官先前發布了一項命令,指出雖然 Anthropic 在獲取書籍時涉及的盜版行為需承擔責任,但隨後在這些書籍上訓練 LLM 的行為構成了合理使用。

這種區別表明,AI 公司的法律風險可能較少在於「學習」過程本身,而更多在於所使用數據集的來源。此次和解的核心問題並非使用書籍進行訓練,而是書籍本身是盜版的。

行業與社群反應

此次和解在法律專家和創意社群之間引發了關於懲罰是否充分以及對 AI 行業影響的重大辯論。

對和解金額的批評

許多觀察家認為,15 億美元這個數字雖然看似龐大,但代表的是「營運成本」而非威懾力。批評者指出,聯邦版權法對於商業侵權行為可處以監禁和重罰,認為民事和解是一個寬大處理的結果。

"This is not even than a slap on the wrist. Publishers who negotiated this really fucked up writers. According to US federal law, pirating a single copyrighted work and gaining commercial advantage of it... represents five years in prison and a $250,000 fine."

支持開放獲取的論點

相反,有些人認為目前的版權制度是一種人為壟斷,阻礙了資訊的有效流動。從這個角度來看,在現有知識上訓練 AI 被視為資訊獲取方式的必要演進,重點應該放在保護私人個人數據,而非商業交易的作品。

對其他模型的影響

此次和解引發了關於其他 AI 開發商的疑問,尤其是那些開發「開放」模型的開發商。如果 Anthropic 使用的數據集在業界是通用的,那麼其他模型開發商也可能在訓練數據的來源方面面臨類似的法律挑戰。

Sources