Hugging Face Ethics and Society Newsletter #2: 機械学習におけるバイアスへの対処

Hugging Face は、機械学習におけるバイアスへの対処に関する包括的なガイドを公開し、バイアスが単一の技術的介入だけでは解決できない複雑な社会技術的課題であることを強調しています。主なポイントは、機械バイアスを差別に基づく被害のリスク要因として捉えるべきであり、緩和には機械学習開発サイクルのすべての段階で共有された責任が必要であるということです。

機械バイアスは社会的危害のリスク要因

機械バイアスとは、システムが否定的なステレオタイプを符号化したり、人口集団間で性能の差異を示したりするメカニズムであり、既存の社会的不平等を増幅させる可能性があります。Hugging Face は、オートメーションとスケールがこれらの問題を悪化させる主な4つの方法を特定しています。

  1. Locking in behaviors: テクノロジーは社会的バイアスを時間的に固定し、社会的進歩を阻害する可能性があります。
  2. Spreading harmful behaviors: バイアスはトレーニングデータの元のコンテキストを超えて拡散する可能性があります。
  3. Amplifying inequities: システムは予測時にステレオタイプ的な関連に過度に焦点を当て、不平等を増幅させることがあります。
  4. Removing recourse: バイアスは「ブラックボックス」システム内に隠蔽され、影響を受けた個人が正義を求めることが困難になることがあります。

コンテキストの役割

バイアスはモデルの静的な属性ではなく、展開コンテキストに依存します。モデルレベルの機械バイアスはあるアプリケーションでは無関係でも、別のアプリケーションでは壊滅的になることがあります。例えば、プロフェッショナルな設定と明るい肌色を結びつけるテキストから画像へのモデルは、以下のようなリスク要因です:

  • モデルが人物が明示的に無効化された背景に使用される場合は 無関係
  • Wikipedia のストック画像に使用される場合は ステレオタイプを増幅
  • 警察が容疑者スケッチを生成するために使用する場合は 直接的な差別を引き起こす

機械学習開発サイクル全体でのバイアス緩和

バイアスは遍在し複雑であるため、Hugging Face は開発の3つの重要な段階を対象とした多面的アプローチを推奨しています。

1. タスク定義

バイアスの影響は、タスクの定義や最適化する目的に起因することが多いです。例えば、エンゲージメントのみを最適化したレコメンデーションシステムは、メディアの多様性を低下させ、過去のステレオタイプを固定化してしまう可能性があります。

タスク定義に関する推奨事項:

  • ML導入前に、分野におけるバイアスの報告を調査する。
  • 使用ケースに特有のリスクがある人口統計カテゴリを特定する。
  • 最適化目的がバイアスを強化していないか検討し、多様性と長期的なプラスの影響を重視した代替案を探る。

2. データセット作成

データセットはしばしば人間のステレオタイプを符号化し、代表性に欠けるため、性能の差異を生じさせます。Hugging Face は、開発者がデータの出所、表現されている人物、作成プロセスを熟考することを提案しています。

データセット分析の主要ツール:

  • Dataset Cards: 社会的影響とバイアスに関する洞察を共有するためのドキュメンテーションフレームワーク。
  • Disaggregators Library: データセットの構成を定量化し、代表性に関する害を最小化するツール。
  • Data Measurements Tool: 正規化点相互情報量 (nPMI) を用いて、用語間のステレオタイプ的な関連(例:性別代名詞)を明らかにするツール。

3. モデル訓練と選択

モデルにおけるバイアスを文書化・測定することで、開発者は特定のアプリケーションに最も安全なモデルを選択したり、新たなモデルの訓練を指針としたりできます。

評価と可視化の戦略:

  • Model Cards: 倫理的考慮事項と分割評価のためのレポーティングフレームワーク。
  • Output Visualization: 生成モデルの場合、形容詞や職業ごとの出力を比較することで再現されたステレオタイプを特定できます。分類モデルの場合、SEAL app のようなツールが類似したミスをグループ化し、性能差につながる失敗モードを特定します。
  • Quantitative Benchmarks: BOLD、HONEST、WinoBias などのベンチマークを活用し、言語モデルの特定の振る舞いを評価します。
  • Evaluation on the Hub: 大規模モデルに対する評価を実行するツールで、個々の開発者にとって計算コストが過大になることを防ぎます。

Hugging Face バイアス緩和ツールの概要

段階 推奨ツール
タスク定義 ML Tasks directory, Task Exploration tool
データセット作成 Dataset Cards, Disaggregators library, Data Measurements Tool
モデル開発 Model Cards, SEAL app, DiffusionBiasExplorer, Evaluation on the Hub, Bias Score Cards

Sources