Microsoft와 OpenAI의 내부 문서, AI 스크래핑 및 시장 대체에 대한 인정 드러나

The New York Times가 OpenAI와 Microsoft를 상대로 제기한 저작권 소송에서 공개된 편집되지 않은 문서는 AI 학습 관행이 막대한 노동력 착취를 구성하며, 그들이 의존하는 콘텐츠 제작자들에게 직접적인 경제적 위협이 된다는 내부적 인정을 담고 있습니다. 이 문서들은 두 기업이 자사의 제품이 원본 소스를 대체할 수 있다는 점을 인지하고 있었으며, AI가 데이터 공급망의 경제적 기반을 파괴하는 '파멸의 고리(doom loop)'를 만들 수 있음을 알고 있었음을 시사합니다.

'절도'와 '실존적 위협'에 대한 내부적 인정

내부 통신 내용은 공개적인 '공정 이용(fair use)' 방어 논리와 경영진의 사적인 평가 사이의 극명한 대조를 보여줍니다. Microsoft의 응용 과학 이사인 Brent Hecht는 2023년 1월 내부 메모에서 AI 스크래핑을 "전례 없는 규모의 놀라운 절도"이자 "인류 역사상 가장 큰 노동력 절도"라고 묘사했습니다.

마찬가지로 OpenAI 경영진도 자사 기술의 파괴적인 성격을 인정했습니다. ChatGPT 책임자인 Nick Turley는 출판사들이 AI 제품으로 인해 "실존적 위협"에 직면해 있으며, 이러한 제품들은 "대체적인 성격이 강하고" 기술이 발전함에 따라 더욱 그렇게 될 것이라고 적었습니다. OpenAI의 사장 Greg Brockman은 모델들이 "뉴스에 탁월하다"고 묘사했으며, Microsoft CEO Satya Nadella는 챗봇 상호작용이 사용자가 원본 소스 웹사이트를 방문할 필요성을 "대체"했다고 증언했습니다.

시장 대체와 '파멸의 고리'

Microsoft의 내부 데이터에 따르면 Copilot을 '답변 엔진'으로 배포한 결과 원본 출판사로의 트래픽이 크게 감소했습니다. 구체적으로 The New York Times 도메인의 클릭률은 기존 Bing 검색 결과와 비교했을 때 최대 93%까지 하락했습니다.

2024년 1월 발표에서 Brent Hecht는 이러한 추세를 "파멸의 고리"라고 묘사하며, "최종 제품이 필수 공급업체의 경제적 기반을 위협하는 것은 매우 이례적인 일"이라고 지적했습니다. 이는 AI가 소스 웹사이트 방문의 필요성을 대체하는 데 성공함으로써, 고품질 학습 데이터를 생산하는 생태계를 파괴하여 결과적으로 모델 자체의 성능을 저하시키는 체계적인 위험을 시사합니다.

페이월 우회 및 데이터 삭제 의혹

이 문서들은 OpenAI와 Microsoft가 학습 데이터를 획득하기 위해 사용한 구체적인 방법들을 상세히 기술하고 있으며, 여기에는 페이월 우회 및 저작권 고지 삭제 의혹이 포함되어 있습니다.

  • 페이월 우회: 문서들은 OpenAI 연구원들이 The New York Times의 페이월을 우회하기 위한 "해킹" 방법을 개발했으며, 이에 대해 OpenAI 사장 Greg Brockman이 "아, 좋네(ah nice)"라고 반응했다고 주장합니다.
  • 저작권 삭제: 두 기업은 모델이 최종 사용자에게 저작권 고지를 출력하지 못하도록 학습 데이터에서 의도적으로 저작권 고지를 삭제했다는 의혹을 받고 있습니다.
  • 데이터 규모: OpenAI의 학습 중간 데이터셋에는 The New York Times, Daily News, Center for Investigative Reporting의 저작물 사본이 91,692개 이상 포함된 것으로 알려졌습니다. Common Crawl에서 파생된 데이터셋에는 nytimes.com에서만 가져온 200만 개 이상의 문서가 포함되었습니다.
  • 협력적 스크래핑: 이 문서는 OpenAI가 GPT-3 학습 데이터셋을 Microsoft에 전달했으며, Microsoft는 "Project Taxi" 및 "Project Mango"라는 이니셔티브를 통해 OpenAI에 학습 데이터를 제공했다고 주장합니다.

법적 맥락과 공정 이용

이러한 인정은 AI 기업들이 일반적으로 사용하는 '공정 이용' 방어 논리를 복잡하게 만듭니다. 공정 이용의 핵심 기둥 중 하나는 새로운 저작물이 원본 저작물의 시장을 대체하거나 해를 끼쳐서는 안 된다는 것입니다. 그러나 "대체적"인 제품에 대한 내부적 인정과 93%의 클릭률 하락은 AI 모델이 원본 콘텐츠와 직접적으로 경쟁하고 있다는 증거를 제공합니다.

최근 트럼프 행정부가 OpenAI의 무허가 저작물 사용을 옹호하는 의견서를 제출했음에도 불구하고, 공개된 문서들은 원고 측이 학습 과정이 변형적(transformative)인 것이 아니라 시장 대체적이었다고 주장할 수 있는 사실적 근거를 제공합니다.

커뮤니티의 관점과 반론

기술 커뮤니티 내의 토론은 AI 학습의 본질에 대한 깊은 분열을 보여줍니다:

"이것은 우리 문화 전체를 강탈하여 다시 비싼 가격에 되파는 행위입니다... 고려나 보상, 동의 없이 자신의 평생 업적을 빼앗긴 수많은 사람들이 있습니다."

반면, 일부는 이 과정이 절도보다는 인간의 학습과 더 유사하다고 주장하며, 저작권법이 LLM의 규모를 감당하기에는 부적절하다고 제안합니다:

"복제는 없고, 오직 수집만 있을 뿐입니다... 우리 사회는 이러한 추상적인 것들이 공유재에 속한다고 명시적으로 결정했으며, 바로 그것들이 이 연구소들이 수확한 것들입니다."

다른 비평가들은 "노동력 절도"라는 표현의 아이러니를 지적하며, 대서양 횡단 노예 무역과 같은 역사적 잔혹 행위가 인류 역사상 실제 가장 큰 노동력 절도임을 언급하며, 그러한 언어는 기업 내부 메모치고도 과장된 것이라고 주장했습니다.

Sources

관련