Authors Guild訴OpenAI事件においてOpenAI幹部が違法な書籍盗難および職業の脅威を認めた
幹部らが違法な盗難書籍の使用を認めた
Authors Guild訴訟の文書によると、OpenAIとMicrosoftは、知られている盗難物資のソースであるLibGenリポジトリから著作権のある書籍を意図的に訓練データに組み込みました。内部のSlackメッセージは、2022年にLibGenファイルを削除して証拠を隠すことを上層部が議論していたことを確認しています。これは著作権法の故意違反を示しています。
"OpenAIがニュースで大きく取り上げられている今こそ、Libgenをシステムとストレージから削除する適切な時期です。そのために必要なことは何ですか?" – OpenAI研究部門副社長 Bob McGrew、2022年6月15日(クラス原告の法的メモ)。
幹部らは法的リスクよりも"印象"を気にした
OpenAIのリーダーシップは、LibGenの使用がネガティブな広報を引き起こす可能性に懸念を示しました。特にHacker Newsでの反応が心配でした。Dario Amodeiはこのデータセットを「やや怪しい」と表現し、研究者であるSam McCandlishは「印象(optics)の問題にのみ気を遣っていた。つまり、'OpenAIが怪しいロシアのウェブサイトから著作権のあるデータを使用している'という話がHacker Newsに上がるのは不愉快だ」と述べました。
"私はただ印象の問題に気を遣っていたのです。つまり、'OpenAIが怪しいロシアのウェブサイトから著作権のあるデータを使用している'という話がHNに上がるのは不愉快です。" – Sam McCandlish(クラス原告の法的メモ)。
このコメントは、主な懸念が法的遵守ではなく、評判の問題であることを示しています。
幹部らはモデルが作家を置き換えると予測していた
複数の内部文書は、OpenAIのスタッフがモデルが人間の作家を置き換える可能性があると認識していたことを示しています。政策責任者Jack Clarkは2020年5月に、"AIと創造性に関する我々の取り組みは、ますます人間の労働を代替するシステムを作り出すことにつながるだろう… GPT-Xの成果が良ければ良いほど、ジャンル小説の作家たちは、我々がアマゾンで彼らの代わりに働くことに不安を感じるようになるだろう"と警告しました。
"我々のこの分野での取り組みは人々を失業させることになる… その懸念を無視して、我々はおそらくそれでもリリースするだろう。" – Jack Clark(内部メモ、2020年5月)。
2022年にモデルの文章品質を向上させるために採用されたTarun Gogineniは、研究の使命が『ジョージ・R・R・マーティンの『氷と炎の歌』シリーズの最後の2冊をGPTで書くこと』であり、『GRRMが早期に亡くなっても、GPT-5がシリーズを自動補完する』と安心できると明言しました。
"世界は間もなく、『読者の死』を経験するだろう。なぜなら『機械が他の機械のために粗悪なコンテンツを作り出す』からだ。" – Gogineni、内部ノート(クラス原告の訂正されたRule 56.1証明書)。
Microsoftは当初から認識していた
Microsoftの幹部は、2019年4月にSam AltmanとDario Amodeiがビル・ゲイツとCTOのKevin ScottにGPT-3の初期プロトタイプを提示した際、LibGenの使用について事前に報告されていたとされています。この説明会では、LibGenのソースについて明確に開示されていました。
"Microsoftは、2019年4月にSam AltmanとDario AmodeiがGPT-3の初期版をビル・ゲイツに提示し、LibGenの使用を明らかにした際、OpenAIがLibGenを使用していることを認識していた。" – Authors Guildの提出文書。
法的および文化的な賭け
原告らは、被告らの行動が故意の侵害に該当し、米国の著作権法下で法定損害賠償額が劇的に増加する可能性があると主張しています。また、人間の創造性をAI生成テキストに置き換えることで、文化的エコシステムが脅かされていると主張し、これを『書籍を執筆・出版する人々にとっての生存的脅威』と表現しています。
"OpenAIのGPTモデルは、書籍を執筆・出版する人々にとって生存的脅威である。" – Authors GuildのCEO Mary Rasenberger。
Hacker Newsでのコミュニティの反応
Hacker Newsでの議論のコメントは、さまざまな見解を反映しています:
- 一部のユーザーは、職業への脅威を一般的な技術的変化と捉え、自動車が馬車に取って代わったことと比較しました。
- 他のユーザーは、訴訟のフレーミングがロビー活動であると批判し、Authors Guildのプレスリリースの中立性を疑問視しました。
- 少数のユーザーは、LibGen使用の具体的な証拠に注目し、このデータセットが圧倒的に著作権のある教科書で構成されているため、『公共財』という主張を無効にしていると指摘しました。
- 複数のコメントでは、OpenAIがHacker Newsでのネガティブな報道を気にするあまり、データ実践の合法性よりも気にしていることに不満を示しました。
"Dario Amodei … ただ印象の問題に気を遣っていたのです。つまり、'OpenAIが怪しいロシアのウェブサイトから著作権のあるデータを使用している'という話がHacker Newsに上がるのは不愉快です。" – 投稿内で引用(Hacker Newsのコメント by papergirl)。
提出文書がAI業界に与える意味
裁判所がOpenAIとMicrosoftが故意に行動したと判断した場合、損害賠償額は数十億ドルに達する可能性があり、著作権のある作品を許可なく大規模にAIトレーニングに使用することは違法であるという前例を確立します。この事件は、創造的専門職を置き換える可能性のあるモデルを構築する倫理的含みについて、業界が直面する必要がある課題を突きつけます。
"今後数か月の間にさらに詳細な資料が提出され、2027年初頭に聴聞が予定されています。" – Authors Guildの提出文書。
結果は、将来のデータ収集ポリシー、ライセンス交渉、さらには著作権のある資料で訓練されたAIに関する立法行動を促す可能性があります。
すべての引用は、Authors Guildのプレスリリースにリンクされているクラス原告の法的メモ(Docket 1982)およびクラス原告の訂正されたRule 56.1証明書(Docket 1987)から直接引用されています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch