OpenAI 在 ChatGPT 中评估公平性的研究摘要
TL;DR
OpenAI 发布了一项研究,显示 ChatGPT 的回复在少于 0.1% 的情况下会因用户姓名而出现有害刻板印象,且整体答案质量在性别和种族姓名提示下保持一致。该工作引入了一种使用 GPT‑4o 驱动的语言模型研究助理(LMRA)的隐私保护方法来基准测试第一人称公平性,并将成为 OpenAI 模型评估套件的标准组成部分。
研究方法
回答: OpenAI 使用基于 GPT‑4o 的语言模型研究助理(LMRA)分析了数百万真实的 ChatGPT 对话记录,而不暴露原始用户数据。LMRA 评估姓名条件化的回复是否包含有害刻板印象,并将其判断与人工评审进行比较。
- LMRA 检查公开的聊天摘录,其中相同的提示使用了不同的用户名(例如 “John” 与 “Amanda”)。
- 对于每一对,LMRA 将回复分类为 有害刻板印象 或 无,随后在 9 个领域的 66 项任务以及 6 种模型变体中汇总结果。
- 使用人工评审来验证 LMRA 的准确性;在性别相关判断上一致率超过 90%,但在种族/民族刻板印象上较低。
关键发现
回答: 在所有评估的模型中,ChatGPT 无论用户姓名的性别或种族含义如何,都能提供同等高质量的答案,而有害刻板印象的出现极为罕见。
- 整体回复质量(准确性、幻觉率)在不同姓名组之间没有可测量的差异。
- 有害刻板印象的实例总体约占 0.1%;老模型在特定领域有时会达到约 1%。
- 输出较长的开放式任务(例如 “写一个故事”)更容易出现刻板印象,例如女性化的姓名会促使生成女性主角的故事。
- 模型偏差排名:GPT‑3.5 Turbo 偏差最高;更新的模型(GPT‑4o‑mini 及以后)在所有任务中均低于 1% 的阈值。
按领域划分的刻板印象率(GPT‑4o‑mini 由 LMRA 评估)
| 领域 | 示例任务 | 有害刻板印象率 |
|---|---|---|
| 就业 | 职业建议 | < 0.1 % |
| 商业与营销 | 制定商业计划 | < 0.1 % |
| 法律 | 起草法律文件 | < 0.1 % |
| 教育 | 解答数学题 | < 0.1 % |
| 艺术 | 创作说唱歌曲 | < 0.1 % |
| 娱乐 | 写一个故事 | < 0.1 % |
| 所有聊天(汇总) | — | < 0.1 % |
分析局限性
回答: 本研究仅限于英文文本交互、基于美国姓名的二元性别假设,以及四个种族/民族类别(黑人、亚洲人、拉美裔、白人)。
- 并非所有用户都会披露姓名;其他标识符也可能影响公平性。
- 该方法尚未覆盖非文本模态(音频),尽管相关的语音公平性工作已在 GPT‑4o 系统卡中出现。
- LMRA 在种族/民族刻板印象上的与人工评审一致率较低,表明自动偏见检测仍有提升空间。
- 美国以外的文化背景和非英语语言仍未被检验。
含义与后续步骤
回答: 通过将此测量管道嵌入标准评估工具包,OpenAI 能够持续追踪并降低偏见,为部署决策提供依据并提升透明度。
- 基于 LMRA 的方法提供了可复现的第一人称公平性基准,外部研究者可采用,因为 OpenAI 已公开使用的系统提示。
- 后续工作将扩展至更多人口统计特征、语言和多模态输入,旨在细化 “有害刻板印象” 的定义并提升 LMRA 的准确性。
- 研究结果进一步证明新一代模型在公平性方面取得了可衡量的进步,支持 OpenAI 更广泛的安全与信任目标。
结论
OpenAI 的 “Evaluating fairness in ChatGPT” 研究表明,基于姓名的偏见极为罕见(< 0.1 %),且在性别和种族姓名提示下,回复质量保持一致。隐私保护的 LMRA 方法为第一人称公平性评估树立了新标准,将被纳入未来模型评估,并公开共享以促进社区范围的研究与合作。
欲了解完整技术细节,请参阅原公告中链接的论文。
SUMMARY: OpenAI 的研究发现,基于姓名的有害刻板印象出现在不到 0.1% 的 ChatGPT 回复中,且整体答案质量在性别和种族姓名提示下保持一致。
TITLE: OpenAI 在 ChatGPT 中评估公平性的研究摘要
Sources
- OriginalEvaluating fairness in ChatGPT