Anthropic Research: 言語モデルの意思決定における差別を評価し、軽減する

Anthropicは、社会的に重要な意思決定に言語モデル(LM)が適用される際、潜在的な差別が発生する可能性を事前に評価し、軽減するための手法を開発しました。この研究は、多様なシナリオにおけるモデルの回答に含まれるバイアスのパターンを特定することに焦点を当てており、開発者や政策立案者が展開前にこれらのリスクを測定し、対処するためのフレームワークを提供します。

差別的影響の評価手法

Anthropicの評価フレームワークは、意思決定者が現実世界のアプリケーションで使用する可能性のある幅広いプロンプトを生成するために、言語モデルを使用します。研究者たちは、差別的な結果が生じるかどうかをテストするために、これらのプロンプト内の人口統計学的情報を体系的に変化させました。

  • テストの範囲: 研究者たちは、金融や住宅の適格性を含む、さまざまな社会的文脈にわたる70の多様な意思決定シナリオにわたってモデルをテストしました。
  • プロセス: 人口統計学的マーカーを変化させることで、研究者たちは、モデルの意思決定プロセスにおける人口統計学的情報の効果を分離して特定することができました。
  • プロアクティブなアプローチ: この手法により、モデルがまだ展開されていない仮説的なユースケースの評価が可能になり、リスクが発生する前に予測することができます。

Claude 2.0に関する知見

介入なしでClaude 2.0にこの手法を適用した際、研究者たちは特定の状況において、ポジティブおよびネガティブの両方の差別のパターンを特定しました。これは、モデルがプロンプトの人口統計学的情報に基づいて、特定の人口統計学的グループを有利または不利に扱う可能性があることを示しています。

軽減策と安全ガイドライン

Anthropicは、調査対象となった高リスクなユースケースにおいて、言語モデルを自動的な意思決定に使用することを支持または許可していないと明示していますが、慎重なプロンプトエンジニアリングを通じて、差別を大幅に減少させることができることを示しました。

軽減ツールとしてのプロンプトエンジニアリング

ポジティブおよびネガティブの両方の差別を減らすために、慎重なプロンプトエンジニアリングが使用されました。研究者たちは、プロンプト内に公平性と中立性を確保するための具体的な指示や制約を提供することが、より安全な結果につながる可能性があることを発見しました。

展開に関する考慮事項

この研究は、モデルの評価が、LMの能力が拡大するにつれて、システム的なバイアスに対処するためのプロアクティブな措置であることを強調しています。Anthropicは、モデルの公平性に関するさらなる研究を可能にするため、Hugging Faceを通じてデータセットとプロンプトを公開しています。

AIの安全性と政策への影響

この研究は、開発者や政策立案者が、AIシステムにおける差別を予測、測定、および対処するための道筋を提供します。幅広いシナリオにわたって人口統計学的情報を変化させる体系的な方法を確立することで、AIコミュニティは、社会的なアプリケーションにおける言語モデルのより公平な展開に向けて前進することができます。

Sources

関連