OpenAI とジャーナリズム:ニューヨーク・タイムズ訴訟への対応
OpenAIは、ニューヨーク・タイムズからの訴訟に対し、主張は根拠がなく、公開されているインターネット上の資料でAIモデルを訓練することはフェアユースに該当すると公に回答しました。同社はジャーナリズムを支援しており、モデルの出力における訓練データの「再現」(regurgitation) を排除するために積極的に取り組んでいると述べています。
AI訓練のフェアユースとオプトアウトメカニズム
OpenAIは、公開されているインターネット資料を使用してAIモデルを訓練することは、長年の判例に基づくフェアユースとして許容されると主張しています。同社は、この原則がイノベーターにとって不可欠であり、米国のAI競争力を維持するために重要であると論じています。
この立場を裏付けるため、OpenAIは米国著作権局にコメントを提出した幅広い支持者を挙げています。その中には:
- 学者
- 図書館協会
- 市民社会団体
- スタートアップ
- 米国の大手企業
- クリエイターや著者
OpenAIは、欧州連合、日本、シンガポール、イスラエルでも、著作権で保護されたコンテンツを用いたモデル訓練を許可する類似の法律が存在することも指摘しています。フェアユースに関する法的立場にもかかわらず、OpenAIは出版社が自社のサイトへのツールアクセスを防止できるシンプルなオプトアウト手続きを提供しており、ニューヨーク・タイムズは2023年8月にこの手続きを採用しました。
コンテンツ「再現」への対処
OpenAIは「再現」――特定の訓練データの記憶――を学習プロセスの稀な失敗と定義しています。同社は、モデルは特定のテキストを記憶するのではなく、一般的な概念を学び新たな問題に適用するよう設計されていると述べています。
OpenAIによれば、コンテンツが複数の公開ウェブサイトに何度も掲載されている場合に再現が起こりやすいとされています。これに対処するため、同社は意図しない記憶を制限する措置を実施しています。また、モデルを意図的に再現させる操作は利用規約違反であると強調しています。
ニュース組織との協業
OpenAIは、3つの主要な目的に焦点を当てたパートナーシップを通じて、健全なニュースエコシステムの支援を目指しています。
- 運用支援:ストーリーの翻訳や膨大な公的記録の分析など、記者や編集者の時間のかかる作業を支援する製品を提供すること。
- モデル強化:追加の歴史的で非公開のコンテンツを用いてモデルを訓練すること。
- 読者との接続:ChatGPT内でリアルタイムコンテンツを出典付きで表示し、出版社が読者とつながる新たな方法を提供すること。
既存のパートナーシップには、Associated Press、Axel Springer、American Journalism Project、NYUとの協業が含まれます。
ニューヨーク・タイムズの主張への対応
OpenAIは、ニューヨーク・タイムズが法的紛争に関する全容を提示していないと主張しています。同社は、ChatGPTでのリアルタイム表示と出典付与に関する高価値パートナーシップの交渉が2023年12月19日まで建設的に進んでいたと述べています。
コンテンツ再現の主張に関して、OpenAIは以下のとおり主張しています:
- ニューヨーク・タイムズは、OpenAIが調査にコミットしたにもかかわらず、交渉中に再現の具体例の共有を繰り返し拒否した。
- ニューヨーク・タイムズが挙げた例は、数年前の文章であり、サードパーティのウェブサイトに拡散したものと思われる。
- ニューヨーク・タイムズは、長文の抜粋を含む対抗的プロンプトを使用し、モデルにコンテンツを再現させることを意図的に試みた可能性が高く、これは一般的なユーザーの利用形態ではない。
Sources
- OriginalOpenAI and journalism