OpenAI のデータと AI に対するアプローチ
OpenAI は、クリエイターやコンテンツ所有者が自分の作品が機械学習の研究やトレーニングに含まれるか除外されるかを直接管理できるようにする新しいツール「Media Manager」を開発しています。この取り組みは、AI 時代におけるコンテンツの社会契約を確立し、多様なトレーニングデータの必要性とクリエイターや出版社の権利とのバランスを取るための広範な戦略の一環です。
Media Manager とクリエイターのコントロール
OpenAI は、コンテンツ所有者が AI トレーニングに関する自分の希望を表明できるスケーラブルなソリューションとして Media Manager を構築しています。OpenAI は以前、ウェブクローラの許可(robots.txt 標準に似たもの)を利用して出版社がトレーニングからオプトアウトできるように先駆けましたが、多くのクリエイターが自分のコンテンツがホストされているウェブサイトを管理できないため、これらのシグナルは不完全であることを認めています。
- Timeline: ツールを 2025 年までに導入することが目標です。
- Technical Requirement: ツールの開発には、複数のソースにわたる著作権で保護されたテキスト、画像、音声、動画を識別する最先端の機械学習研究が必要です。
- Objective: OpenAI は、Media Manager がクリエイターが自分のコンテンツと AI システムとの関係を管理するための業界標準になることを期待しています。
データ取得とモデル訓練
OpenAI は、モデルの知識、理解、言語能力を向上させるために、規模と多様性が拡大するデータセットを用いて、基礎モデルの各新世代をゼロから訓練しています。同社は主に以下の 3 つのデータカテゴリに依存しています:
- Publicly Available Data: これには業界標準の機械学習データセットやウェブクローリングが含まれます。OpenAI は、課金壁があるもの、主に個人を特定できる情報(PII)を集約するもの、会社のポリシーに違反するもの、または明示的にオプトアウトしたものは除外します。
- Proprietary Data Partnerships: OpenAI は、アーカイブやメタデータなどの非公開コンテンツにアクセスするためにパートナーシップを結んでいます。例として、Sora の訓練用のプライベートビデオライブラリや、アイスランド政府との提携による先住言語の保存があります。OpenAI は、すでに純粋に公開されている情報に対して有料パートナーシップを追求しないと述べています。
- Human Feedback: モデルは、AI トレーナー、レッドチーム、従業員、およびデータ制御設定でモデル改善にオプトインしたユーザーからのフィードバックを用いて洗練されます。
出版社パートナーシップと発見
「注意経済」からクリエイターを支援する形へ移行するため、OpenAI は出版社のコンテンツを自社製品に直接統合し、ユーザーとオリジナルソースとの可視性とつながりを高めています。
- Source Attribution: ChatGPT はソースリンクを改善するアップデートを受け、ユーザーにより良いコンテキストを提供し、出版社に新たなオーディエンスとの接続手段を提供しています。
- Strategic Partnerships: OpenAI は、Financial Times、Le Monde、Prisa Media、Axel Springer などの世界的なニュース組織とパートナーシップを結び、これらのコンテンツを ChatGPT に表示し、ニュースルームで利用できるツールを改善しています。
- Educational Partnerships: Khan Academy と ExamSolutions との協業により、モデルの数学的パフォーマンスが向上し、パーソナライズされた AI チュータリングが拡大されています。
データプライバシーと使用ポリシー
OpenAI は、プライバシーとビジネス機密を保護するため、訓練に使用されるデータに関して特定の境界を設けています:
- Business Data: OpenAI は、ChatGPT Team、ChatGPT Enterprise、または API Platform のデータで訓練を行いません。
- User Control: ChatGPT Free および Plus のユーザーは、アカウント設定を通じて自分のデータが将来のモデル改善に貢献するかどうかを管理できます。
- Sensitive Information: 同社は個人情報や機微情報の処理を減らす技術を採用し、個人に関するプライベートまたは機微なデータを提供しないようにモデルを訓練しています。
Sources
- OriginalOur approach to data and AI