Hugging Face Ethics and Society ニュースレター #4: テキスト・トゥ・イメージ モデルにおけるバイアス

Hugging Faceは、テキスト・トゥ・イメージ(TTI)モデルのバイアスを検出および対処するための改善された評価方法の必要性を特定しました。これらのモデルは多様な社会技術的文脈でますます導入されているため、既存の社会的不平等や文化的ステレオタイプを増幅するリスクがあります。

テキスト・トゥ・イメージ システムにおけるバイアスのソース

TTIモデルのバイアスは単一の失敗の結果ではなく、機械学習パイプラインの複数の段階から生じます。Hugging Faceは5つの主要なソースを特定しています:

  • トレーニングデータ: 人気のマルチモーダルデータセット(LAION-5B、MS-COCO、VQA v2.0など)には有害な関連性とバイアスが含まれています。たとえば、Stable Biasプロジェクトは、画像生成における多様性の欠如と、アイデンティティグループのステレオタイプの継続を指摘しました。たとえば、Dall-E 2が生成するCEOやマネージャーの画像では多様性が欠けています。
  • プリトレーニングデータフィルタリング: データセットをクリーンにすることを目的としたフィルタリングプロセスは、意図せずバイアスを増幅する可能性があります。OpenAIは、Dall-E 2のトレーニングデータのフィルタリングがバイアスを増加させた可能性があると報告しています。これは、既存のデータセットが女性を性的な文脈で表現する傾向があるためかもしれません。
  • 推論(CLIPモデル): Stable DiffusionやDall-E 2などのモデルは、プロンプトのエンコードにCLIPモデルを依存しています。CLIPは人種、性別、年齢に関するバイアスが文書化されており、プロンプトが不明瞭な場合、「白人、中年、男性」をデフォルトとして扱うことがよくあります。
  • 潜在空間: モデルの潜在空間の内部構造はバイアスを反映する可能性があります。たとえば、Fair Diffusionなどの一部の研究では、表現を改善するために性別などの軸に沿って生成をガイドする方法を探っていますが、潜在空間が出力にどのように影響するかを理解するためにはさらなる研究が必要です。
  • 事後フィルタリング: 組み込まれた安全フィルターはしばしば堅牢性に欠けます。Stable Diffusionの安全フィルターのレッドチームングにより、性的コンテンツを効果的に特定する一方で、暴力的、グロテスク、または不快なコンテンツをフラグ付けすることがしばしば失敗することが明らかになりました。

バイアス検出のための技術的アプローチ

バイアスへの対処は、技術だけでは解決できない社会技術的課題です。Hugging Faceは、モデルの限界についての洞察を得るために、以下の方法の組み合わせを提案しています:

探索ツール

Stable Biasプロジェクトの一部として、Hugging Faceはモデル間のバイアスを可視化および比較するツールを開発しました:

  • 平均ディフュージョンフェイス: このツールは、特定の職業(たとえば、「清掃員」)の平均表現を計算し、異なるモデル(Stable Diffusion v1.4、v2、Dall-E 2など)がその役割をどのように視覚化するかを比較します。
  • フェイスクラスタリングとカラフルネスプロフェッションエクスプローラー: これらのツールは、事前に定義されたラベルに依存せずに、生成されたデータのパターンとステレオタイプをユーザーが特定できるようにします。

レッドチームング

レッドチームングは、プロンプトを通じてモデルにストレステストをかけて、脆弱性とバイアスを明らかにすることを含みます。Hugging Faceは、このプロセスが現在adhoc(臨時的)であり、体系的なベンチマークやリーダーボードがないことを指摘しています。現在、レッドチームングプロンプトの主要なオープンソースリソースは、Anthropicのデータセットのみで、これは英語の自然言語テキストに限定されています。

ドキュメンテーションと評価

バイアスの報告を標準化するために、Hugging Faceはモデルカード、データシート、READMEの使用を提唱しています。レッドチームングと探索ツールの結果をモデルの重みとともに共有することにより、クリエイターはモデルの既知のバイアスについての透明性を提供できます。

バリューアライメントの課題

検出を超えて、Hugging Faceは、モデルが単にデータを模倣すべきか、または「理想的」な社会の特定のバージョンを積極的に推進すべきかという倫理的ジレンマを提起しています。このアプローチは、価値が文化や個人によって異なるため、「誰の価値」がプログラムされているかという問題を引き起こします。

これらのバイアスの影響も、ダウンストリームアプリケーションに大きく依存します:

  • 低リスク: グラフィックデザイン(RunwayMLなど)のような人間-in-the-loop設定では、ユーザーはプロンプトを調整することでバイアスを手動で修正できます。
  • 高リスク: フォレンジックアーティストのための警察スケッチをDall-E 2で作成するようなハイステイク環境では、バイアスが危険な人種的および社会的ステレオタイプを強化する可能性があります。

エシックスと社会のアップデート追加

  • コンテンツポリシー: Hugging Faceは、コアバリューとして同意を強調するようにコンテンツポリシーを更新しました。
  • AIアカウンタビリティポリシー: Hugging Faceは、AIのアカウンタビリティに関するNTIAの意見募集への回答を提出し、透明性、ドキュメンテーション、オープンなコラボレーションの必要性を強調しました。

Sources