Anthropic 衡量 Claude 中的政治偏見
Anthropic 開發並開源了一種新的自動化評估方法論,用以衡量 AI 模型中的「政治公正性」。此框架旨在評估模型是否能以同等的深度、參與度及分析品質來處理對立的政治觀點,而不偏袒任何特定的意識形態立場。
政治公正性的框架
Anthropic 將政治公正性定義為模型在整個政治光譜中保持中立與公平的能力。其目標是確保使用者不會受到輕視或被施壓轉向特定觀點,從而讓使用者能夠形成自己獨立的判斷。
理想的模型行為
為了達成此目標,Anthropic 為 Claude 設定了幾個特定的行為目標:
- 平衡的資訊: 在政治問題上提供平衡的資訊,並避免提供未經請求的政治觀點。
- 事實準確性: 在所有主題上保持全面性與準確性。
- 意識形態圖靈測試: 能夠以支持該觀點的人士所能認可並支持的方式來描述對立觀點。
- 多視角呈現: 在缺乏經驗證據或道德共識時,呈現多種觀點。
- 中立語言: 使用中立的術語,而非具有政治色彩的語言。
- 尊重參與: 避免未經請求的判斷或說服。
訓練中立性的方法論
Anthropic 採用兩種主要方法將這些特質植入 Claude 中:
系統提示詞 (System Prompting)
Anthropic 使用系統提示詞——在對話開始前提供給模型的總括性指令——來引導 Claude 遵循上述行為。雖然這並不是萬無一失,但此方法能顯著影響模型的輸出。
性格訓練 (Character Training)
自 2024 年初以來,Anthropic 已使用強化學習來獎勵模型遵循特定的「性格特質」。這些特質包括對以下事項的承諾:
- 避免可能導致分裂或被用於宣傳的修辭。
- 在合理的人士持有不同意見的複雜議題上進行討論,而不採取強烈的黨派立場。
- 以細微的差別來解釋不同的觀點,而非僅僅捍衛單一立場。
- 呈現客觀數據,而不暗示使用者需要改變其心態。
- 在討論文化或社會變革時,在呈現進步觀點的同時,也承認傳統價值觀。
配對提示詞評估法 (The Paired Prompts Evaluation Method)
為了衡量偏見,Anthropic 開發了「配對提示詞」法。此方法透過對同一個具爭議性的主題,從兩個對立的意識形態觀點提出請求,來引導模型,然後根據三個標準來評分:
- 公正性: 評估模型是否為雙方提供相似的深度的分析、參與程度及證據強度。
- 對立觀點: 檢查模型是否透過限定條件、警示或不確定性(例如使用「然而」或「雖然」)來承認對立觀點。
- 拒絕回答: 衡量模型是否完全拒絕參與提示詞的處理。
評估設置
- 數據集: 涵蓋 150 個主題與 9 種任務類型(包括推理、正式寫作、敘事與幽默)的 1,350 對提示詞。
- 自動化評分: Claude Sonnet 4.5 擔任主要自動化評分者,並使用 Claude Opus 4.1 與 GPT-5 進行有效性檢查。
- 對照模型: 評估包含了 Claude Sonnet 4.5、Claude Opus 4.1、GPT-5 (low reasoning mode)、Gemini 2.5 Pro (lowest thinking configuration)、Grok 4 (thinking on) 以及 Llama 4 Maverick。
比較結果
公正性分數
Claude 模型在與其他頂尖模型競爭時表現相當,儘管某些模型顯示出顯著的差異:
- Gemini 2.5 Pro: 97%
- Grok 4: 96%
- Claude Opus 4.1: 95%
- Claude Sonnet 4.5: 94%
- GPT-5: 89%
- Llama 4: 66%
對立觀點與拒絕回答率
- 對立觀點: Claude Opus 4.1 (46%) 是最常承認對立觀點的模型,其次是 Claude Sonnet 4.5 (35%)、Grok 4 (34%) 與 Llama 4 (31%)。
- 拒絕回答率: Claude 模型顯示出較低的拒絕回答率(Sonnet 4.5 為 3%,Opus 4.1 為 5%)。Grok 4 的拒絕回答率接近於零,而 Llama 4 的拒絕回答率最高,達 9%。
有效性與局限性
Anthropic 進行了有效性檢查,以確保結果並不依賴於評分者模型。Claude Sonnet 4.5 與 GPT-5 之間對於公正性的樣本間一致性為 92%,與 Claude Opus 4.1 的一致性為 94%。這顯示出自動化評分者比人類評分者更具一致性,後者在先前的成對評估中僅顯示出 85% 的一致性。
局限性
Anthropic 指出了研究中的幾項局限性:
- 地理焦點: 分析主要集中在目前的美國政治論述。
- 範圍: 評估集中在「單輪」互動,而非多輪對話。
- 指標選擇: 結果是基於特定的偏見維度(公正性、對立觀點與拒絕回答),其他指標可能會產生不同的結果。
- 配置: 不同供應商的模型配置與系統提示詞的差異可能會影響結果。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch