MicrosoftとOpenAIの内部文書がAIスクレイピングと市場の置き換えに関する認識を露呈
The New York TimesがOpenAIとMicrosoftを提訴している現在進行中の著作権訴訟において、非公開とされていた文書が公開されました。これには、AIの学習慣行が膨大な労働の流用にあたり、依存しているコンテンツクリエイターに対して直接的な経済的脅威をもたらしているという、両社の内部での認識が記されています。これらの文書は、両社が自社の製品が元のソースの代替となり得ることを認識しており、AIが自身のデータ供給源である経済的基盤を破壊するという「破滅のループ(doom loop)」を生み出す可能性があることを示唆しています。
「窃盗」と「存続の危機」に関する内部認識
内部通信からは、公の場での「フェアユース(公正利用)」という弁明と、幹部による非公開の評価との間に大きな乖離があることが明らかになりました。Microsoftの応用科学担当ディレクターであるBrent Hecht氏は、2023年1月の内部メモの中で、AIスクレイピングを「前例のない規模の驚くべき窃盗」であり、「人類史上最大の労働の窃盗」であると表現しました。
同様に、OpenAIの経営陣も自社技術の破壊的な性質を認めていました。ChatGPTの責任者であるNick Turley氏は、パブリッシャーは「大部分が代替的(substitutive)」であり、技術の向上とともにその傾向が強まるAI製品によって「存続の危機」に直面していると記しました。OpenAIの社長であるGreg Brockman氏は、これらのモデルを「ニュースに関しては優秀」と評し、MicrosoftのCEOであるSatya Nadella氏は、チャットボットとの対話がユーザーが元のソースサイトを訪問する必要性を「置き換えて(substituted)」いると証言しました。
市場の置き換えと「破滅のループ」
Microsoftの内部データによると、Copilotを「回答エンジン」として展開したことで、元のパブリッシャーへのトラフィックが大幅に減少したことが示されています。具体的には、The New York Timesドメインへのクリックスルー率は、従来のBing検索結果と比較して最大93%低下しました。
2024年1月のプレゼンテーションで、Brent Hecht氏は、この傾向を「破滅のループ」と表現し、「最終製品がその不可欠な供給元の経済的基盤を脅かすというのは非常に異例なことだ」と指摘しました。これは、AIがソースサイトを訪問する必要性を置き換えることに成功すればするほど、高品質な学習データを生成するエコシステムを破壊し、モデル自体のパフォーマンスを損なうというシステム上のリスクを示唆しています。
ペイウォール回避とデータ剥離の疑惑
これらの文書には、OpenAIとMicrosoftが学習データを取得するために使用した具体的な手法が詳述されており、その中にはペイウォールの回避や著作権表示の削除の疑いも含まれています。
- ペイウォール回避: 文書では、OpenAIの研究者がThe New York Timesのペイウォールを回避するための「ハック」を開発したと主張されており、OpenAIの社長であるGreg Brockman氏がこれに対して「ah nice(お、いいね)」と反応したと報告されています。
- 著作権表示の剥離: 両社は、モデルがエンドユーザーに対して著作権表示を出力しないように、学習データから意図的に著作権表示を削除したとされています。
- データの規模: OpenAIの学習中データセットには、The New York Times、Daily News、およびCenter for Investigative Reportingの作品のコピーが91,692件以上含まれていたと報告されています。Common Crawl由来のデータセットには、
nytimes.comだけで200万件以上のドキュメントが含まれていました。 - 共同スクレイピング: この文書は、OpenAIがGPT-3の学習データセットをMicrosoftに提供し、一方でMicrosoftは「Project Taxi」や「Project Mango」と呼ばれる取り組みを通じてOpenAIに学習データを提供していたと主張しています。
法的背景とフェアユース
これらの認識は、AI企業が通常用いる「フェアユース」の弁護を複雑にするものです。フェアユースの重要な柱は、新しい作品が元の作品の市場を代替したり、害を与えたりしてはならないという点です。しかし、「代替的」な製品に関する内部認識や93%のクリックスルー率の低下は、AIモデルが元のコンテンツと直接競合しているという証拠を提供しています。
トランプ政権が最近、OpenAIによる著作権保護された素材の無許可使用を擁護する準備書面を提出しましたが、公開された文書は、原告側が学習プロセスは変革的ではなく、むしろ市場の置き換えであると主張するための事実上の根拠を提供しています。
コミュニティの視点と反論
技術コミュニティ内での議論は、AI学習の性質をめぐって深い分断があることを浮き彫りにしています。
「これは我々の文化すべてを強奪し、上乗せ価格で売り戻す行為だ... 多くの人々の生涯をかけた仕事が、配慮も補償も同意もなく流用された」
一方で、このプロセスは窃盗というよりも人間の学習に近いと主張し、著作権法はLLMの規模に対応できていないと示唆する声もあります。
「コピーなど存在せず、あるのは収集のみだ... 我々は社会として、これらの抽象的な事柄は公共財に属すると明示的に決定しており、それこそがこれらの研究所が収穫したまさにそのものだ」
他の批評家は、「労働の窃盗」という表現の皮肉を指摘し、大西洋奴隷貿易のような歴史的な残虐行為こそが人類史上最大の労働の窃盗であり、そのような言葉遣いは企業の内部メモであっても誇張が過ぎると主張しました。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch