OpenAI データパートナーシップ

OpenAIは、組織と協力して公共およびプライベートなデータセットを作成し、AIモデルのトレーニングに使用するデータパートナーシッププログラムを導入しました。このイニシアチブは、トレーニングデータの幅を広げ、AIモデルが多様な主題、産業、文化、言語を深く理解できるようにすることを目的としています。OpenAIはこれが安全で有益な人工一般知能(AGI)を創出するために不可欠であると述べています。

データ取得の目標と要件

OpenAIは、人間社会を反映し、現在オンラインで一般に容易にアクセスできない大規模なデータセットを求めています。このプログラムは、長文の文章や会話など、人間の意図を表現するデータに焦点を当て、断片的なスニペットではなく、そのようなデータを重視しています。

主な技術的要件と機能には以下が含まれます:

  • Multimodal Support: OpenAIはテキスト、画像、音声、ビデオと作業できます。
  • Data Digitization: 同社は社内のAI技術を使用して、パートナーがデータをデジタル化し構造化できるよう支援します。これには、PDF向けの世界クラスの光学文字認識(OCR)と、話された言葉を転写する自動音声認識(ASR)が含まれます。
  • Data Cleaning: OpenAIは、パートナーのチームと協力してデータを処理し、自動生成されたアーティファクトや転写エラーを削除することを提案します。
  • Exclusions: このプログラムは、機密性または個人情報を含むデータセット、または第三者に属する情報を含むデータセットを特に除外します。

パートナーシップモデル

組織は、以下の2つの異なる経路を通じてOpenAIとパートナーシップを結ぶことができます:

オープンソースアーカイブ

この経路は、AIモデルのトレーニングに誰でも利用できるオープンソースデータセットを作成したいパートナー向けです。OpenAIはまた、これらのデータセットを使用して追加のオープンソースモデルをトレーニングする場合があります。

プライベートデータセット

この経路は、特定のドメインにおけるAIの理解を向上させながらデータを非公開に保ちたい組織向けです。これらのデータセットは、基盤モデル、ファインチューンモデル、カスタムモデルなどの独自のAIモデルのトレーニングに使用されます。OpenAIは、パートナーが望む機密性とアクセス制御でこのデータを扱うことを約束します。

実際の応用と例

OpenAIは、特定の分野でのモデルパフォーマンスを向上させるために、これらのパートナーシップをすでに実施しています:

  • Language Support: OpenAIは、アイスランド政府およびMiøeind ehfと提携し、キュレートされたデータセットを統合して、GPT-4のアイスランド語話能力を向上させました。
  • Legal Understanding: 非営利組織Free Law Projectとのパートナーシップが設立され、AIトレーニングに大規模な法的文書コレクションを含め、法的理解へのアクセスを民主化しました。

Sources