ChatGPT PlusおよびEnterpriseでのDALL·E 3の統合

OpenAIはDALL·E 3をリリースし、現在はChatGPT PlusおよびEnterpriseユーザーが利用可能です。このモデルは、画像生成における大きな進歩を表しており、前バージョンと比較して視覚的品質が向上し、詳細度が高く、複雑で詳細なプロンプトに従う能力が強化されています。

プロンプト従順性における技術的進歩

DALL·E 3は、最先端の画像キャプション生成器を使用してトレーニングデータの高品質なテキスト説明を生成することにより、プロンプト従順性を向上させています。これらの改善されたキャプションでトレーニングを行うことにより、モデルはユーザーが提供したキャプションに対してはるかに注意を払うようになり、テキスト、手、顔などの複雑な詳細を確実にレンダリングできるようになりました。

視覚的機能とフォーマット

DALL·E 3は、以前のバージョンよりも視覚的に際立ち、詳細が鮮明な画像を生成します。このモデルは、横向きおよび縦向きの両方を含む複数のアスペクト比をサポートし、ユーザーが柔軟なフォーマット要件を持つ画像を作成できるようにします。

セーフティシステムとコンテンツモデレーション

OpenAIは、成人向け、暴力的、または憎悪的なコンテンツを含む有害な画像の生成を防ぐため、多層的なセーフティシステムを採用しています。このシステムは、ユーザーに配信される前に、初期のユーザープロンプトおよび生成された画像の両方に対してセーフティチェックを実行することで動作します。

これらのシステムをさらに改善するため、OpenAIはエキスパートのレッドチーマーおよび初期ユーザーと協力し、カバレッジのギャップを特定して対処しました。このプロセスは、性的イメージなどのグラフィックコンテンツのエッジケースを特に対象とし、誤解を招く画像を生成するモデルの能力をテストしました。

アーティストおよび公的人物の保護

デプロイメントの準備の一環として、OpenAIは、生きているアーティストのスタイルや公的人物の画像を生成する可能性を制限するための対策を実施しました。また、生成された画像における人口統計的表現の改善にも焦点を当てました。

AIの出所と検出

OpenAIは、DALL·E 3によって画像が生成されたかどうかを識別するために設計された内部出所分類器を評価しています。内部評価により、以下の正確性が示されています:

  • 変更されていない画像: DALL·E 生成画像を識別する精度が99%以上。
  • 変更された画像: JPEG圧縮、サイズ変更、トリミング、または実際の画像の切り抜きの重ね合わせなどの一般的な変更を施した画像については、95%以上の精度。

これらの結果は強力ですが、OpenAIは現在、この分類器が確定的な結論ではなく生成の可能性を提供していることに注意しています。このツールは、AI生成の視覚コンテンツと実際の画像を区別するユーザーを支援するため、AIバリューチェーン全体での協力を促進するより広範な取り組みの一部です。

Sources