OpenAI 在大型语言模型中的政治偏见定义与评估
OpenAI 引入了一个全面的框架,用于定义和衡量大型语言模型(LLMs)中的政治偏见,以确保 ChatGPT 默认保持客观。公司报告称,其最新模型 GPT-5 instant 和 GPT-5 thinking 相较于之前的模型将政治偏见降低了约 30%,估计所有生产响应中显示偏见的比例不足 0.01%。
用于衡量政治偏见的新框架
OpenAI 的方法摒弃了传统的多项选择基准,如政治罗盘测试,公司认为这些基准仅覆盖日常使用的狭窄片段。相反,OpenAI 开发了一种评估,透过开放式情境和细致互动来映射真实世界的使用情况。
评估范围与方法论
评估聚焦于基于文本的回复,排除网络搜索行为,因为后者涉及独立的检索系统。该过程包括三个主要步骤:
- Representative Prompt Set:一个约 500 条提示的数据集,涵盖 100 个主题(来源于美国党派平台和文化议题)。每个主题包括五种变体:中性、略偏自由、略偏保守、自由倾向强、保守倾向强。
- Measurable Axes of Bias:OpenAI 确定了偏见在模型输出中表现的五种具体方式:
- User invalidation:驳回或否定用户的观点(例如使用讽刺引号)。
- User escalation:镜像并放大提示中的政治立场。
- Personal political expression:将政治观点呈现为模型本身的意见,而非外部观点。
- Asymmetric coverage:在存在多种合法视角时,选择性地强调某一方或省略其他方。
- Political refusals:在没有依据
Model Spec的有效理由下,拒绝回应政治查询。
- Automated LLM Grader:使用一个 LLM 评分器(
GPT-5 thinking)根据详细的评分标准和参考答案,对回复进行 0 到 1 的打分(0 表示完全客观)。
模型客观性的关键发现
OpenAI 的评估显示,尽管偏见仍然存在,但在其模型系列中出现的频率低且严重程度轻。
各代模型的表现
GPT-5 instant 和 GPT-5 thinking 展示了与客观性目标最高的一致性。这些模型相较于之前的模型(如 GPT-4o 和 o3)将偏见得分降低了约 30%。
偏见出现的条件
模型在中性或略有倾向的提示上通常保持客观。然而,当面对具有挑战性、情绪化的提示时,会出现中等程度的偏见。OpenAI 指出这种效应存在不对称性,称“强烈倾向自由的提示对模型系列的客观性影响最大,超过倾向保守的提示”。
常见的偏见形式
当偏见出现时,最常以三种方式表现:
- Personal opinion:将政治观点框定为模型本身的意见。
- Asymmetric coverage:在需要多元视角的议题中,只强调一方。
- Emotional escalation:使用放大用户政治倾向的语言。
现实中的普遍性与未来工作
对生产流量的代表性样本进行分析表明,所有 ChatGPT 回复中显示政治偏见的比例不足 0.01%。这一低比例归因于政治倾向查询的稀少以及模型整体的稳健性。
OpenAI 正在持续投入改进,以进一步使模型符合其 Model Spec,特别是针对最可能引发偏见回复的情绪化提示进行针对性优化。