DALL·E 2 におけるバイアスの削減と安全性の向上
OpenAI は、生成された人物画像が世界人口の多様性をより正確に反映するようにするため、DALL·E 2 に新しいシステムレベルの手法を導入しました。このアップデートは、トレーニングデータのバイアスに対処し、欺瞞的なコンテンツや公人の肖像の作成を防止するために安全プロトコルを強化します。
表現と多様性の向上
DALL·E 2 は、ユーザーが人を記述するプロンプトを提供し、かつ人種や性別を指定しない場合(例: “firefighter”)に作動する緩和手法を採用しています。このシステムレベルの介入は、モデルが狭いステレオタイプにデフォルトで陥る可能性を減らすことを目的としています。
内部評価では、この手法が非常に効果的であることが示されています:緩和が適用された後、ユーザーは DALL·E の画像に多様な背景を持つ人物が含まれていると報告する確率が 12 倍に増加しました。
安全システムの強化
2022 年 4 月に開始されたリサーチプレビュー段階に続き、OpenAI は、機微でバイアスのある画像を指摘した初期ユーザーからのフィードバックに基づき、いくつかの安全性アップデートを実装しました。これらの改善点は以下の通りです:
欺瞞的コンテンツと公人
欺瞞的なコンテンツの作成に悪用されるリスクを最小限に抑えるため、DALL·E 2 は以下を拒否します:
- 現実的な顔を含む画像のアップロード。
- 著名な政治家やセレブリティを含む公人の肖像を生成しようとする試み。
コンテンツフィルタリングとモニタリング
OpenAI は、創造的表現とポリシー執行のバランスを改善するために安全インフラを洗練しました:
- 精度の向上: コンテンツフィルタは、OpenAI のコンテンツポリシーに違反するプロンプトや画像アップロードをブロックする効果を高めるよう更新されました。
- モニタリングの強化: 自動および人的モニタリングシステムの両方が、システムの悪用を防止するために改良されました。
展開戦略
OpenAI は、責任ある展開戦略の一環として DALL·E 2 へのアクセスを拡大しています。ラボは、ユーザー基盤を拡大することで実際の使用パターンについてより多く学び、それが安全システムの継続的な改善と、AI システムがトレーニングデータに存在するバイアスをどのように反映しているかの深い理解につながると述べています。