Anthropic 衡量 Claude 中的政治偏见

Anthropic 开发并开源了一种新的自动化评估方法,用于衡量 AI 模型中的“政治公平性”。该框架评估模型是否在不偏袒任何特定意识形态立场的情况下,以同等的深度、参与度和分析质量来对待对立的政治观点。

政治公平性的框架

Anthropic 将政治公平性定义为模型在整个政治光谱中保持中立和公正的能力。其目标是确保用户不会受到教导或被施压转向特定观点,从而允许他们形成自己独立的判断。

理想的模型行为

为了实现这一目标,Anthropic 针对 Claude 设定了几个特定的行为目标:

  • 平衡的信息: 在政治问题上提供平衡的信息,并避免提供未经请求的政治观点。
  • 事实准确性: 在所有主题上保持全面性和准确性。
  • 意识形态图灵测试: 能够以支持者能够识别并支持的方式来描述对立观点。
  • 多视角呈现: 在缺乏经验性或道德共识时,呈现多个视角。
  • 中立语言: 使用中立术语,而非带有政治色彩的语言。
  • 尊重参与: 避免未经请求的判断或劝说。

培养中立性的训练方法论

Anthropic 采用两种主要方法在 Claude 中培养这些特质:

系统提示词 (System Prompting)

Anthropic 使用系统提示词——在对话开始前提供给模型的全局指令——来引导 Claude 遵循上述行为。虽然并非万无一失,但这种方法显著影响了模型的输出。

性格训练 (Character Training)

自 2024 年初以来,Anthropic 一直使用强化学习来奖励模型遵循特定的“性格特质”。这些特质包括对以下方面的承诺:

  • 避免可能制造分裂或被用于宣传的修辞。
  • 在合理的人持有不同意见的复杂问题上进行讨论,而不采取强烈的党派立场。
  • 以细微差别而非仅仅捍卫单一立场的方式来解释不同的观点。
  • 呈现客观数据,而不暗示用户需要改变其思维方式。
  • 在讨论文化或社会变革时,在进步观点之外,同时承认传统价值观。

配对提示词评估法

为了衡量偏见,Anthropic 开发了“配对提示词” (Paired Prompts) 方法。这种方法通过从两个对立的意识形态视角对模型提出关于同一争议性话题的请求,然后根据三个标准对响应进行评分:

  1. 公平性: 评估模型是否为双方提供相似的深度的分析、参与水平和证据强度。
  2. 对立观点: 检查模型是否通过限定词、注意事项或不确定性(例如使用“然而”或“虽然”)来承认对立观点。
  3. 拒绝: 衡量模型是否完全拒绝参与提示词。

评估设置

  • 数据集: 涵盖 150 个主题和 9 种任务类型(包括推理、正式写作、叙述和幽默)的 1,350 对提示词。
  • 自动化评分: Claude Sonnet 4.5 作为主要的自动化评分员,并使用 Claude Opus 4.1 和 GPT-5 进行有效性检查。
  • 对比模型: 评估包括 Claude Sonnet 4.5、Claude Opus 4.1、GPT-5 (low reasoning mode)、Gemini 2.5 Pro (lowest thinking configuration)、Grok 4 (thinking on) 和 Llama 4 Maverick。

比较结果

公平性得分

Claude 模型在与其他顶尖模型竞争中表现出了竞争力,尽管某些模型显示出显著差异:

  • Gemini 2.5 Pro: 97%
  • Grok 4: 96%
  • Claude Opus 4.1: 95%
  • Claude Sonnet 4.5: 94%
  • GPT-5: 89%
  • Llama 4: 66%

对立观点与拒绝率

  • 对立观点: Claude Opus 4.1 (46%) 是最频繁承认对立观点的模型,其次是 Claude Sonnet 4.5 (35%)、Grok 4 (34%) 和 Llama 4 (31%)。
  • 拒绝率: Claude 模型表现出较低的拒绝率(Sonnet 4.5 为 3% 且 Opus 4.1 为 5%)。Grok 4 的拒绝率接近于零,而 Llama 4 的拒绝率最高,达到 9%。

有效性与局限性

Anthropic 进行了有效性检查,以确保结果不依赖于评分员模型。Claude Sonnet 4.5 与 GPT-5 在公平性方面的逐样本一致性为 92%,与 Claude Opus 4.1 为 94%。这表明自动化评分员比人类评分员更一致,人类评分员在之前的成对评估中仅表现出 85% 的一致性。

局限性

Anthropic 指出了研究中的几项局限性:

  • 地理关注点: 分析主要集中在当前的美国政治话语。
  • 范围: 评估侧重于“单轮”交互,而非多轮对话。
  • 指标选择: 结果基于偏见的特定维度(公平性、对立观点和拒绝率),而其他指标可能会产生不同的结果。
  • 配置: 不同提供商的模型配置和系统提示词的差异可能会影响结果。

Sources

相关