Authors Guild 소송에서 OpenAI 경영진, 불법 도서 침해 및 일자리 위협 인정
경영진, 불법 도서 침해 인정
Authors Guild 소송 문서는 OpenAI와 Microsoft가 LibGen 저장소에서 유출된 저작권 보호 도서를 훈련 데이터에 의도적으로 포함시켰음을 보여줍니다. LibGen은 알려진 불법 자료 출처입니다. 내부 Slack 메시지는 2022년에 LibGen 파일을 제거해 증거를 숨기기 위해 고위 임원들이 논의했다는 것을 확인합니다. 이는 저작권법을 의도적으로 위반했음을 보여줍니다.
"OpenAI가 언론에 많이 노출되고 있는 지금이 시스템과 저장소에서 Libgen을 제거하기에 적절한 시기입니다. 그 과정에 어떤 일이 포함될까요?" – OpenAI 연구 부사장 로버트 맥그루, 2022년 6월 15일 (클래스 소송 당사자 법적 메모).
법적 위험보다 '시각적 이미지'에 대한 우려
OpenAI 리더십은 LibGen 사용이 부정적인 여론을 초래할 수 있다는 점에 우려를 표했습니다. 특히 Hacker News에서의 반응이 걱정되었습니다. 다리오 아모데이는 이 데이터셋을 "조금 의심스럽다"고 평가했고, 연구원 샘 맥캔들리시는 "시각적 이미지( optics )에 대한 우려만 있었을 뿐입니다. 즉, 'OpenAI가 의심스러운 러시아 웹사이트에서 저작권 침해 데이터를 사용한다'는 내용이 Hacker News에 올라오면 안타까울 것입니다."라고 말했습니다.
"저는 시각적 이미지에 대한 우려만 있었을 뿐입니다. 즉, 'OpenAI가 의심스러운 러시아 웹사이트에서 저작권 침해 데이터를 사용한다'는 내용이 HN에 올라오면 안타까울 것입니다." – 샘 맥캔들리시 (클래스 소송 당사자 법적 메모).
이 발언은 주된 우려가 법적 준수보다는 명성 문제였음을 보여줍니다.
모델이 작가를 대체할 것이라고 예측
내부 문서들은 OpenAI 직원들이 모델이 인간 작가를 대체할 수 있을 것이라고 믿었다는 점을 보여줍니다. 정책 책임자 잭 클락은 2020년 5월에 "우리가 AI와 창의성에 대한 연구를 계속할수록, 사람들의 노동을 대체하는 시스템을 만들게 될 것입니다… GPT-X에서 얼마나 잘하는지에 따라, 장르 소설 작가들이 우리에게 대체당할 것에 대해 점점 더 걱정하게 될 것입니다. 아마존에서 말이죠."
"우리의 작업은 사람들을 실직하게 만들 것입니다… 우리는 그들의 우려를 무시하고 출시할 가능성이 큽니다." – 잭 클락 (내부 메모, 2020년 5월).
2022년에 모델의 글쓰기 품질을 향상시키기 위해 고용된 타룬 고기니니는, 자신의 연구 목표가 조지 R. R. 마틴의 『냉혹한 계절의 노래』 시리즈의 마지막 두 권을 GPT가 쓰게 하는 것이라고 직접 밝혔으며, "GRRM이 조기에 사망하더라도 GPT-5가 그 시리즈를 자동 완성할 수 있다는 사실에 마음을 놓을 수 있다"고 말했습니다.
"세상은 곧 '독자의 죽음'을 경험하게 될 것입니다. 왜냐하면 '기계들이 기계들을 위한 난잡한 글을 만들기 때문'입니다." – 고기니니, 내부 노트 (클래스 소송 당사자 수정된 규칙 56.1 진술).
Microsoft는 처음부터 알고 있었다
Microsoft 경영진은 2019년 4월, 사무 앨트먼과 다리오 아모데이가 빌 게이츠와 CTO인 키파 스콧에게 초기 GPT-3 프로토타입을 발표했을 때부터 LibGen 사용에 대해 보고받았습니다. 보고서에는 LibGen 출처에 대한 명시적인 공개가 포함되어 있었습니다.
"Microsoft는 2019년 4월, 사무 앨트먼과 다리오 아모데이가 빌 게이츠에게 GPT-3의 초기 버전을 발표하고 LibGen 사용을 공개했을 때부터 OpenAI의 LibGen 사용을 알고 있었습니다." – Authors Guild 제출 문서.
법적 및 문화적 의미
원고들은 피고들의 행위가 고의적 침해에 해당한다고 주장하며, 이는 미국 저작권법 하에서 통상 손해배상액을 크게 증가시킬 수 있다고 말합니다. 또한, 인간 창작물을 AI 생성 텍스트로 대체함으로써 문화 생태계가 위협받고 있다고 주장하며, 이를 "책을 쓰고 출판하는 사람들에게 존재적 위협"이라고 묘사합니다.
"OpenAI의 GPT 모델은 책을 쓰고 출판하는 사람들에게 존재적 위협을 제기합니다." – Authors Guild 회장 메리 라센버거.
Hacker News 커뮤니티 반응
Hacker News 토론에 달린 댓글들은 다양한 시각을 반영합니다:
- 일부 사용자는 일자리 위협을 일반적인 기술적 혁신의 결과로 보며, 자동차가 마차를 대체한 것과 비교했습니다.
- 다른 사용자들은 소송을 로비 활동으로 보며, Authors Guild 보도자료의 중립성에 의문을 제기했습니다.
- 일부는 LibGen 사용의 구체적 증거를 강조하며, 이 데이터셋이 대부분 저작권 보호 교과서로 구성되어 있어 "공공 영역" 방어가 무의미하다고 지적했습니다.
- 여러 사용자는 OpenAI가 Hacker News에서의 부정적 보도에 더 신경 쓰는 것 같아 실망했다고 표현했습니다.
"다리오 아모데이 … 시각적 이미지에 대한 우려만 있었을 뿐입니다. 즉, 'OpenAI가 의심스러운 러시아 웹사이트에서 저작권 침해 데이터를 사용한다'는 내용이 Hacker News에 올라오면 안타까울 것입니다." – 게시물에서 인용 (Hacker News 댓글, papergirl).
소송이 AI 산업에 미치는 의미
법원이 OpenAI와 Microsoft가 고의적으로 행동했다고 판단할 경우, 손해배상액은 수십억 달러에 이를 수 있으며, 라이선스 없는 저작권 보호 자료를 대규모로 AI 훈련에 사용하는 것이 불법임을 전제로 하는 사례를 만들게 됩니다. 이 사건은 또한 AI 모델이 창작 전문가를 대체할 수 있는 방식으로 구축되는 것의 윤리적 함의를 산업이 직면하게 만듭니다.
"우리는 다음 몇 달 동안 더 많은 보고서를 기대하며, 2027년 초에 청문회가 열릴 것으로 예상합니다." – Authors Guild 제출 문서.
결과는 향후 데이터 수집 정책, 라이선스 협상, 심지어 저작권 보호 자료를 기반으로 한 AI 훈련에 대한 입법 활동을 이끌어낼 가능성이 큽니다.
- 모든 인용문은 Authors Guild 보도자료에 링크된 클래스 소송 당사자 법적 메모(Docket 1982) 및 클래스 소송 당사자 수정된 규칙 56.1 진술서(Docket 1987)에서 직접 인용되었습니다.*
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch