AnthropicによるClaudeの政治的バイアスの測定
Anthropicは、AIモデルにおける「政治的な公平性」を測定するための新しい自動評価手法を開発し、オープンソースとして公開しました。このフレームワークは、モデルが特定のイデオロギー的立場を支持することなく、対立する政治的見解に対して同等の深さ、関与、および分析の質で扱っているかどうかを評価します。
政治的な公平性のためのフレームワーク
Anthropicは、政治的な公平性を、モデルが政治的スペクトラム全体にわたって中立かつ公正であり続ける能力と定義しています。その目的は、ユーザーが特定の意見に教示されたり、圧力をかけられたりすることなく、独自の独立した判断を下せるようにすることです。
理想的なモデルの振る舞い
これを達成するために、AnthropicはClaudeに対していくつかの具体的な振る舞いを目標としています:
- Balanced Information: 政治的な質問に対してバランスの取れた情報を提供し、求められていない政治的意見を避けること。
- Factual Accuracy: すべてのトピックにおいて包括性と正確性を維持すること。
- Ideological Turing Test: 対立する見解を、その見解の支持者が認識し支持できるような方法で説明できる能力。
- Multi-perspective Representation: 実証的または道徳的な合意が得られていない場合に、複数の視点を提示すること。
- Neutral Language: 政治的に偏った言葉の代わりに、中立的な用語を使用すること。
- Respectful Engagement: 求められていない判断や説得を避けること。
中立性のためのトレーニング手法
Anthropicは、Claudeにこれらの特性を植え付けるために、主に2つの方法を採用しています:
System Prompting
Anthropicは、会話の前にモデルに提供される包括的な指示であるシステムプロンプトを使用して、Claudeが上記の振る舞いを遵守するように指示します。万能ではありませんが、この方法はモデルの出力に大きな影響を与えます。
Character Training
2024年初頭から、Anthropicは強化学習を使用して、特定の「キャラクター特性」を遵守することに対してモデルに報酬を与える手法を用いています。これらの特性には、以下が含まれます:
- 分断を煽ったり、プロパガンダに使用されたりする可能性のあるレトリックを避けること。
- 合理的な人々が意見を異にする複雑な問題について、強い党派的な立場を取らずに議論すること。
- 単一の立場を擁護するのではなく、ニュアンスを含めて異なる視点を説明すること。
- ユーザーの考え方を変える必要があると示唆することなく、客観的なデータを提示すること。
- 文化的または社会的な変化に関する議論において、進歩的な見解とともに伝統的な価値観も認めること。
Paired Prompts 評価手法
バイアスを測定するために、Anthropicは「Paired Prompts」手法を開発しました。このアプローチでは、モデルに対して、同じ論争的なトピックについて2つの対立するイデオロギー的視点からリクエストを行い、その回答を3つの基準に基づいて採点します:
- Even-handedness: モデルが両方の側に対して、同様の分析の深さ、関与レベル、および証拠の強さを提供しているかどうかを評価します。
- Opposing Perspectives: 修飾語、注意書き、または不確実性(例:「しかし」や「although」を使用すること)を通じて、モデルが反論を認めているかどうかを確認します。
- Refusals: モデルがプロンプトへの対応を完全に拒否するかどうかを測定します。
評価セットアップ
- Dataset: 150のトピックと9つのタスクタイプ(推論、フォーマルなライティング、ナラティブ、ユーモアを含む)にわたる1,350組のプロンプト・ペア。
- Automated Grading: Claude Sonnet 4.5が主な自動採点者として機能し、妥当性チェックはClaude Opus 4.1およびGPT-5を用いて行われました。
- Comparator Models: 評価には、Claude Sonnet 4.5、Claude Opus 4.1、GPT-5 (low reasoning mode)、Gemini 2.5 Pro (lowest thinking configuration)、Grok 4 (thinking on)、および Llama 4 Maverick が含まれました。
比較結果
Even-handedness スコア
Claudeモデルは、他のトップティアのモデルと比較して競争力のあるパフォーマンスを示しましたが、いくつかのモデルには大きなばらつきが見られました:
- Gemini 2.5 Pro: 97%
- Grok 4: 96%
- Claude Opus 4.1: 95%
- Claude Sonnet 4.5: 94%
- GPT-5: 89%
- Llama 4: 66%
Opposing Perspectives と Refusals
- Opposing Perspectives: Claude Opus 4.1 (46%) が最も頻繁に反対の見解を認める傾向にあり、次いで Claude Sonnet 4.5 (35%)、Grok 4 (34%)、Llama 4 (31%) となりました。
- Refusal Rates: Claudeモデルは低い拒否率を示しました(Sonnet 4.5は3%、Opus 4.1は5%)。Grok 4は拒否率がほぼゼロであり、Llama 4は9%で最も高い拒否率を示しました。
妥当性と言い訳
Anthropicは、結果が採点モデルに依存しないことを確認するために、妥当性チェックを行いました。Claude Sonnet 4.5とGPT-5の間での Even-handedness に関するサンプルごとの一致率は 92% であり、Claude Opus 4.1 とは 94% でした。これは、自動採点者が、以前のペアワイズ評価において 85% の一致率しか示さなかった人間による評価者よりも一貫性があることを示唆しています。
Caveats
Anthropicは、本研究におけるいくつかの制限事項を記載しています:
- Geographic Focus: 分析は主に現在の米国の政治的言説に焦点を当てていました。
- Scope: 評価は、マルチターン会話ではなく「シングルターン」のやり取りに焦点を当てていました。
- Metric Selection: 結果はバイアスの特定の次元(Even-handedness、Opposing Perspectives、Opposing Perspectives、Refusals)に基づいているため、他の指標を用いて異なる結果が得られる可能性があります。
- Configuration: プロバイダー間でモデルの構成やシステムプロンプトの違いが結果に影響を与える可能性があります。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch