NYT訴訟でマイクロソフト幹部がAIスクラピングを「人類史上最大の労働力の盗難」と呼び、オープンAIがチャットGPTを出版社への「生存的脅威」と表現

まとめ

ニューヨーク・タイムズの著作権訴訟の法廷文書から、マイクロソフトの応用科学ディレクターであるブレント・ヒッチはAI駆動のウェブスクラピングを「人類史上最大の労働力の盗難」と呼び、オープンAIのチャットGPT責任者は同製品を「出版社にとっての生存的脅威」と表現したことが判明した。これらの発言は、企業が公に主張する公正使用の防衛論を弱体化させ、大規模言語モデルの訓練データに関する今後の訴訟に影響を与える可能性がある。


ニューヨーク・タイムズの要請文書から明らかになった主な事実

  • マイクロソフトの内部メモ(2023年1月) – ヒッチは「何百万人もの人々が、大規模モデルが自分のすべての作品を『吸い上げている』と感じ始めるだろう」と記し、この行為を「人類史上最大の労働力の盗難」と表現した。
  • 別のマイクロソフト文書 – コンテンツ制作者が「自分の作品がこのような形で使われるつもりはなかったし、その使用に対して報酬を得ていない」と警告している。
  • ニューヨーク・タイムズへの影響 – 要請文書で引用された内部データによると、コピロットはBing検索と比較して、ニューヨーク・タイムズのクリック率を最大で**93%**低下させた。これは直接的な市場への影響を示している。
  • オープンAIの内部通信 – チャットGPTの責任者であるニック・ターリーは、チャットボットを「出版社にとっての生存的脅威」と呼び、それが「ほとんど代替可能」であり、モデルが進化するにつれてその傾向が強まると言った。オープンAIのエンジニアは証言した。「どれほど強くリンクを表示しても、ユーザーはクリックしない。」
  • 「ドゥームループ」メモ – ヒッチは、AIエコシステムがウェブのコンテンツ供給チェーンとモデルのパフォーマンスの両方を損なうフィードバックループを生み出していると警告した。

「エンドプロダクトがその必須サプライヤーの経済的基盤を脅かすのは極めて異例だが、それが私たちがLLMビジネスの『コンテンツ供給チェーン』に関して作り出した状況である。」 – ブレント・ヒッチ、マイクロソフト内部メモ(ニューヨーク・タイムズの要請文書で引用)

法的文脈

  • ニューヨーク・タイムズは2023年末、チャットGPTおよびコピロットの訓練に使われた数千のニュース記事について、著作権侵害を理由にオープンAIとマイクロソフトを提訴した。
  • 2026年現在、訴訟は未決。ニューヨーク・タイムズは、新たに明らかになった内部文書に基づいて即決判決を求めており、その根拠として内部メモが市場への損害を認識していたことを示している。
  • AI企業は通常、公正使用(fair use)の防衛論を採用しており、目的、作品の性質、使用量、市場への影響といった要因に依拠している。ニューヨーク・タイムズの要請文書は、内部メモが市場損害を認識していたことを示しており、公正使用の主張を弱めるとしている。
  • 一方、米国の裁判所は以前、アントロピックの公開資料の使用が公正使用に該当すると判断しており、法的不確実性を示している。

スクラピングに関する企業の立場

  • マイクロソフトCEOのサティア・ナデラ(証言) – 「ペイウォールに囲まれたものは、接地や訓練のためにライセンスが必要である」と述べ、もしマイクロソフトがオープンAIがペイウォールコンテンツをスクラップしていたことを知っていたら、モデルの再訓練を要求したと語った。
  • オープンAIの公的立場 – 大規模なウェブスクラピングは、研究および訓練の目的で公正使用に該当すると主張しており、法的定義に「研究」と「学術」が含まれていることを根拠にしている。
  • 業界の反応 – 一部のコメントでは、これらの自認が、データスクラピングが無害であるというAI業界の物語を危うくする可能性があると指摘している。

コミュニティの見解(Hacker Newsのコメント)

  • 継続的なスクラピングの懸念 – ユーザーは、グーグルのAIオーバービュー機能がニュース記事から大規模な正確な引用を再現していると報告しており、ニューヨーク・タイムズの懸念と一致している。AIシステムが出典を明示せずに元のテキストを埋め込んでいる。
  • 捏造の懸念 – コメント投稿者は、ユーザーが独自に考案した用語をLLMが引用なしに再現したと述べ、「真実の広範な腐敗を高速で実行している」と表現した。
  • 企業の責任に対する懐疑 – 一部のユーザーは、マイクロソフトが実際にオープンAIにモデルの再訓練を強制するとは思わない。発言は「良いこと」だが、効果はないと考えている。
  • 広範な知的財産権の議論 – 一部の参加者は、既存の知的財産法がAI訓練データの規模には不適切であり、現在の法的原則が陳腐化する可能性があると主張している。

なぜこれが重要なのか

  1. 訴訟リスク – 内部の自認は、幹部がコンテンツ制作者に直接的な経済的損害を与えていることを認識しているという具体的な証拠を提供し、裁判官が包括的な公正使用防衛論に反対する可能性を高める。
  2. 政策的影響 – もし裁判所がニューヨーク・タイムズに賛同すれば、将来のAI訓練には著作権のある資料の明示的ライセンスが必要になる可能性があり、大規模言語モデルのデータ収集プロセスが大きく変わる。
  3. 出版社の存続 – オープンAIが「生存的脅威」と呼んだことから、ニュース機関がペイウォールの強化やAI生成コンテンツの検出技術などの緩和戦略を急ぐ必要性が強調される。
  4. 業界の信頼性 – 市場への損害を認める発言は、業界がデータ使用を無害と主張する物語と大きく対照的であり、利害関係者や規制当局からの信頼を損なう可能性がある。

デベロッパーおよび政策立案者への教訓

  • 訓練データの監査 – 企業は、出典資料の透明な記録を維持し、ペイウォールコンテンツについてはライセンス契約を検討すべきである。
  • 出典表示の実装 – モデル出力に出典を埋め込むことで、捏造の主張を減らし、公正使用の要因に沿うことができる。
  • 市場影響の監視 – AI製品がオリジナルコンテンツ提供者に与えるトラフィックおよび収益への影響を定量的に把握する。このような指標は、今後の訴訟で証拠として使われる可能性がある。
  • 立法者との協働 – AIに特化した著作権法の改正について前もって対話を行うことで、高コストの訴訟を回避し、許容されるデータ使用方法を明確化できる。

上記情報は、2026年9月18日、Tom’s Hardwareが報じた、ニューヨーク・タイムズがオープンAIおよびマイクロソフトに対して提起した著作権訴訟の法廷文書およびHacker Newsでの議論に基づく。

Sources

関連