Anthropic, 해적판 학습 데이터 사용에 대해 15억 달러 합의

Anthropic $1.5 Billion Settlement Over Pirated Training Data

Anthropic은 Claude 대규모 언어 모델(LLM)을 학습시키기 위해 해적판 도서를 사용했다는 혐의를 해결하기 위해 15억 달러 규모의 합의에 도달했습니다. 이번 합의는 중요한 법적 구분을 강조합니다. 저작권이 있는 텍스트로 AI 모델을 학습시키는 행위는 공정 이용(fair use)으로 간주될 수 있지만, 해적판 소스를 통해 해당 데이터를 획득하는 행위는 그렇지 않다는 점입니다.

Settlement Terms and Payouts

15억 달러 규모의 해결책은 영향을 받은 저자 및 출판사에 재정적 보상을 제공하지만, 집단 소송 대표자와 일반 집단 간의 자금 배분은 크게 다릅니다.

  • Per-Title Payouts: Eligible titles will receive approximately $3,000 each. In traditional publishing contracts, this amount is typically split between the author and the publisher.
  • Class Representative Compensation: The three class representatives are slated to receive $15,000 each.
  • Legal Fees: The presiding judge reduced the class counsel's requested fee by half, lowering it from 12.5% ($187.5 million) to 6.8% ($101 million). Unreimbursed litigation expenses totaled $2.6 million.

Legal Precedent: Piracy vs. Fair Use

A key element of this case는 AI 학습의 성격에 관한 사법적 결정이 핵심 요소입니다. Alsup 판사는 이전에 Anthropic이 도서를 입수하는 과정에서 발생한 해적판 행위에 대해서는 책임이 있지만, 그 도서들을 사용하여 LLM을 학습시키는 후속 행위는 공정 이용에 해당한다고 명시하는 명령을 내린 바 있습니다.

이러한 구분은 AI 기업의 법적 리스크가 '학습' 과정 자체보다는 사용된 데이터셋의 출처(provenance)에 있을 수 있음을 시사합니다. 이번 합의의 핵심 쟁점은 학습을 위해 도서를 사용한 것이 아니라, 도서가 해적판이었다는 사실입니다.

Industry and Community Reaction

이번 합의는 처벌의 적절성과 AI 산업에 미칠 영향에 대해 법률 전문가와 창작 커뮤니티 사이에서 상당한 논쟁을 불러일으켰습니다.

Criticism of the Settlement Amount

많은 관찰자들은 15억 달러라는 금액이 겉보기에는 커 보이지만, 억제력을 갖기보다는 '사업 비용' 정도로 간주될 수 있다고 주장합니다. 비판론자들은 상업적 저작권 침해에 대해 징역형과 무거운 벌금을 부과할 수 있는 연방 저작권법을 언급하며, 민사 합의가 관대한한 결과라고 지적합니다.

"This is not even than a slap on the wrist. Publishers who negotiated this really fucked up writers. According to US federal law, pirating a single copyrighted work and gaining commercial advantage of it... represents five years in prison and a $250,000 fine."

Arguments for Open Access

반대로, 일부는 현재의 저작권 시스템이 정보의 효율적인 이동을 흐름을 방해하는 인위적인 독점 체제라고 주장합니다. 이러한 관점에서는 기존 지식에 대한 AI 학습은 정보 접근성의 필수적인 진화로 간주되며, 초점은 상업적으로 거래되는 저작물 대신 개인의 사적인 데이터를 보호하는 데 맞춰져야 한다고 봅니다.

Implications for Other Models

이 합의는 다른 AI 개발사, 특히 '오픈' 모델을 만드는 개발사들에 대한 의문을 제사기합니다. 만약 Anthropic이 사용한 데이터셋이 업계계 전체에 공통적으로 사용되는 것이라면, 다른 모델 개발사들도 학습 데이터의 출처에 관한 유사한 법적 쟁점을 마주할 수 있습니다로.

Sources