OpenAI が LLM における政治的バイアスを定義し評価する

OpenAI は、大規模言語モデル(LLM)における政治的バイアスを定義し測定するための包括的なフレームワークを導入し、ChatGPT がデフォルトで客観的であることを保証しています。同社は、最新モデルである GPT-5 instant と GPT-5 thinking が、従来のモデルと比較して政治的バイアスを約30%削減し、全生産応答のうち推定で0.01%未満がバイアスの兆候を示すと報告しています。

政治的バイアス測定の新しいフレームワーク

OpenAI のアプローチは、従来の選択肢式ベンチマーク(例:Political Compass テスト)から離れ、同社はそれらが日常使用のごく一部しかカバーしていないと主張しています。その代わりに、OpenAI は、オープンエンドのシナリオと微妙なインタラクションを通じて実際の使用状況を反映した評価を開発しました。

評価の範囲と方法論

評価はテキストベースの応答に焦点を当て、検索システムが別個の取得システムを伴うためウェブ検索行動は除外します。プロセスは主に3つのステップで構成されます:

  1. 代表的なプロンプトセット:米国の政党プラットフォームと文化的課題から派生した、約500件のプロンプトで100テーマをカバーするデータセットです。各テーマは中立、ややリベラル、やや保守、リベラル寄り、保守寄りの5つのバリエーションを含みます。
  2. バイアスの測定軸:OpenAI は、モデル出力にバイアスが現れる5つの具体的な方法を特定しました:
    • ユーザーの無効化:ユーザーの見解を否定または正当性を奪う(例:スケアクオートの使用)。
    • ユーザーのエスカレーション:プロンプトの政治的立場を鏡像化し増幅する。
    • 個人的な政治的表現:政治的意見を外部の見解ではなく、モデル自身の意見として提示する。
    • 非対称的カバレッジ:複数の正当な視点が存在する場合に、一方の視点を選択的に強調したり、他方を省略したりする。
    • 政治的拒否:Model Spec の下で正当な根拠がないにもかかわらず、政治的質問への応答を拒否する。
  3. 自動化された LLM 採点者:LLM 採点者(GPT-5 thinking)を使用し、詳細なルーブリックと参照応答に基づいて、0〜1 のスケール(0 が完全に客観的)で応答を採点しました。

モデルの客観性に関する主要な発見

OpenAI の評価によると、バイアスは存在するものの、頻度は低く、モデルファミリー全体でその深刻度も低いことが明らかになりました。

モデル世代間のパフォーマンス

GPT-5 instant と GPT-5 thinking は、客観性目標との整合性が最も高いことを示しています。これらのモデルは、GPT-4o や o3 などの従来モデルと比較してバイアススコアを約30%削減しました。

バイアスが現れる条件

モデルは一般に、中立的またはやや偏ったプロンプトに対しては客観的であり続けます。しかし、挑戦的で感情的に強く揺さぶられるプロンプトに直面すると、中程度のバイアスが現れます。OpenAI はこの効果に非対称性があると指摘し、"強く感情的なリベラル・プロンプトは、モデルファミリー全体で客観性への影響が最も大きく、保守的な感情的プロンプトよりも大きい" と述べています。

バイアスの一般的な形態

バイアスが発生する場合、最も頻繁に以下の3つの形で現れます:

  • 個人的意見:政治的見解をモデル自身のものとして提示する。
  • 非対称的カバレッジ:複数の視点が必要とされる問題において、一方の側面を強調する。
  • 感情的エスカレーション:ユーザーの政治的傾向を増幅するような言葉遣いを使用する。

実世界での普及状況と今後の取り組み

生産トラフィックの代表的サンプルの分析により、全 ChatGPT 応答のうち0.01%未満が政治的バイアスの兆候を示すことが判明しました。この低率は、政治的に偏った問い合わせが稀であることと、モデル全体の堅牢性に起因しています。

OpenAI は、モデルを Model Spec にさらに合わせるための改善に投資し続けており、特にバイアス応答を引き起こしやすい感情的に強いプロンプトを対象としています。

Sources