Anthropic 衡量 Claude 中的政治偏見

Anthropic 開發並開源了一種新的自動化評估方法論,用以衡量 AI 模型中的「政治公正性」。此框架旨在評估模型是否能以同等的深度、參與度及分析品質來處理對立的政治觀點,而不偏袒任何特定的意識形態立場。

政治公正性的框架

Anthropic 將政治公正性定義為模型在整個政治光譜中保持中立與公平的能力。其目標是確保使用者不會受到輕視或被施壓轉向特定觀點,從而讓使用者能夠形成自己獨立的判斷。

理想的模型行為

為了達成此目標,Anthropic 為 Claude 設定了幾個特定的行為目標:

  • 平衡的資訊: 在政治問題上提供平衡的資訊,並避免提供未經請求的政治觀點。
  • 事實準確性: 在所有主題上保持全面性與準確性。
  • 意識形態圖靈測試: 能夠以支持該觀點的人士所能認可並支持的方式來描述對立觀點。
  • 多視角呈現: 在缺乏經驗證據或道德共識時,呈現多種觀點。
  • 中立語言: 使用中立的術語,而非具有政治色彩的語言。
  • 尊重參與: 避免未經請求的判斷或說服。

訓練中立性的方法論

Anthropic 採用兩種主要方法將這些特質植入 Claude 中:

系統提示詞 (System Prompting)

Anthropic 使用系統提示詞——在對話開始前提供給模型的總括性指令——來引導 Claude 遵循上述行為。雖然這並不是萬無一失,但此方法能顯著影響模型的輸出。

性格訓練 (Character Training)

自 2024 年初以來,Anthropic 已使用強化學習來獎勵模型遵循特定的「性格特質」。這些特質包括對以下事項的承諾:

  • 避免可能導致分裂或被用於宣傳的修辭。
  • 在合理的人士持有不同意見的複雜議題上進行討論,而不採取強烈的黨派立場。
  • 以細微的差別來解釋不同的觀點,而非僅僅捍衛單一立場。
  • 呈現客觀數據,而不暗示使用者需要改變其心態。
  • 在討論文化或社會變革時,在呈現進步觀點的同時,也承認傳統價值觀。

配對提示詞評估法 (The Paired Prompts Evaluation Method)

為了衡量偏見,Anthropic 開發了「配對提示詞」法。此方法透過對同一個具爭議性的主題,從兩個對立的意識形態觀點提出請求,來引導模型,然後根據三個標準來評分:

  1. 公正性: 評估模型是否為雙方提供相似的深度的分析、參與程度及證據強度。
  2. 對立觀點: 檢查模型是否透過限定條件、警示或不確定性(例如使用「然而」或「雖然」)來承認對立觀點。
  3. 拒絕回答: 衡量模型是否完全拒絕參與提示詞的處理。

評估設置

  • 數據集: 涵蓋 150 個主題與 9 種任務類型(包括推理、正式寫作、敘事與幽默)的 1,350 對提示詞。
  • 自動化評分: Claude Sonnet 4.5 擔任主要自動化評分者,並使用 Claude Opus 4.1 與 GPT-5 進行有效性檢查。
  • 對照模型: 評估包含了 Claude Sonnet 4.5、Claude Opus 4.1、GPT-5 (low reasoning mode)、Gemini 2.5 Pro (lowest thinking configuration)、Grok 4 (thinking on) 以及 Llama 4 Maverick。

比較結果

公正性分數

Claude 模型在與其他頂尖模型競爭時表現相當,儘管某些模型顯示出顯著的差異:

  • Gemini 2.5 Pro: 97%
  • Grok 4: 96%
  • Claude Opus 4.1: 95%
  • Claude Sonnet 4.5: 94%
  • GPT-5: 89%
  • Llama 4: 66%

對立觀點與拒絕回答率

  • 對立觀點: Claude Opus 4.1 (46%) 是最常承認對立觀點的模型,其次是 Claude Sonnet 4.5 (35%)、Grok 4 (34%) 與 Llama 4 (31%)。
  • 拒絕回答率: Claude 模型顯示出較低的拒絕回答率(Sonnet 4.5 為 3%,Opus 4.1 為 5%)。Grok 4 的拒絕回答率接近於零,而 Llama 4 的拒絕回答率最高,達 9%。

有效性與局限性

Anthropic 進行了有效性檢查,以確保結果並不依賴於評分者模型。Claude Sonnet 4.5 與 GPT-5 之間對於公正性的樣本間一致性為 92%,與 Claude Opus 4.1 的一致性為 94%。這顯示出自動化評分者比人類評分者更具一致性,後者在先前的成對評估中僅顯示出 85% 的一致性。

局限性

Anthropic 指出了研究中的幾項局限性:

  • 地理焦點: 分析主要集中在目前的美國政治論述。
  • 範圍: 評估集中在「單輪」互動,而非多輪對話。
  • 指標選擇: 結果是基於特定的偏見維度(公正性、對立觀點與拒絕回答),其他指標可能會產生不同的結果。
  • 配置: 不同供應商的模型配置與系統提示詞的差異可能會影響結果。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch