OpenAI 在大型语言模型中的政治偏见定义与评估

OpenAI 引入了一个全面的框架,用于定义和衡量大型语言模型(LLMs)中的政治偏见,以确保 ChatGPT 默认保持客观。公司报告称,其最新模型 GPT-5 instantGPT-5 thinking 相较于之前的模型将政治偏见降低了约 30%,估计所有生产响应中显示偏见的比例不足 0.01%。

用于衡量政治偏见的新框架

OpenAI 的方法摒弃了传统的多项选择基准,如政治罗盘测试,公司认为这些基准仅覆盖日常使用的狭窄片段。相反,OpenAI 开发了一种评估,透过开放式情境和细致互动来映射真实世界的使用情况。

评估范围与方法论

评估聚焦于基于文本的回复,排除网络搜索行为,因为后者涉及独立的检索系统。该过程包括三个主要步骤:

  1. Representative Prompt Set:一个约 500 条提示的数据集,涵盖 100 个主题(来源于美国党派平台和文化议题)。每个主题包括五种变体:中性、略偏自由、略偏保守、自由倾向强、保守倾向强。
  2. Measurable Axes of Bias:OpenAI 确定了偏见在模型输出中表现的五种具体方式:
    • User invalidation:驳回或否定用户的观点(例如使用讽刺引号)。
    • User escalation:镜像并放大提示中的政治立场。
    • Personal political expression:将政治观点呈现为模型本身的意见,而非外部观点。
    • Asymmetric coverage:在存在多种合法视角时,选择性地强调某一方或省略其他方。
    • Political refusals:在没有依据 Model Spec 的有效理由下,拒绝回应政治查询。
  3. Automated LLM Grader:使用一个 LLM 评分器(GPT-5 thinking)根据详细的评分标准和参考答案,对回复进行 0 到 1 的打分(0 表示完全客观)。

模型客观性的关键发现

OpenAI 的评估显示,尽管偏见仍然存在,但在其模型系列中出现的频率低且严重程度轻。

各代模型的表现

GPT-5 instantGPT-5 thinking 展示了与客观性目标最高的一致性。这些模型相较于之前的模型(如 GPT-4oo3)将偏见得分降低了约 30%。

偏见出现的条件

模型在中性或略有倾向的提示上通常保持客观。然而,当面对具有挑战性、情绪化的提示时,会出现中等程度的偏见。OpenAI 指出这种效应存在不对称性,称“强烈倾向自由的提示对模型系列的客观性影响最大,超过倾向保守的提示”。

常见的偏见形式

当偏见出现时,最常以三种方式表现:

  • Personal opinion:将政治观点框定为模型本身的意见。
  • Asymmetric coverage:在需要多元视角的议题中,只强调一方。
  • Emotional escalation:使用放大用户政治倾向的语言。

现实中的普遍性与未来工作

对生产流量的代表性样本进行分析表明,所有 ChatGPT 回复中显示政治偏见的比例不足 0.01%。这一低比例归因于政治倾向查询的稀少以及模型整体的稳健性。

OpenAI 正在持续投入改进,以进一步使模型符合其 Model Spec,特别是针对最可能引发偏见回复的情绪化提示进行针对性优化。

Sources