Anthropic 研究:评估并缓解语言模型决策中的歧视
Anthropic 开发了一种方法,用于在将语言模型 (LMs) 应用于高风险社会决策时,主动评估并缓解潜在的歧视风险。这项研究侧重于识别模型在不同场景下响应中的偏见模式,为开发者和政策制定者提供了一个在部署前衡量并解决这些风险的框架。
评估歧视性影响的方法论
Anthropic 的评估框架使用语言模型生成大量决策者在实际应用中可能使用的潜在提示词 (prompts)。研究人员系统地改变了这些提示词中的人口统计信息,以测试是否存在歧视性结果。
- 测试范围: 研究人员在涵盖各种社会背景(包括金融和住房资格)的 70 个不同决策场景中对模型进行了测试。
- 过程: 通过改变人口统计标记,研究人员可以分离出人口统计信息对模型决策过程的影响。
- 主动方法: 这种方法论允许对模型尚未部署的假设性用例进行评估,从而在风险发生前进行预判。
关于 Claude 2.0 的发现
在不对 Claude 2.0 进行任何干预的情况下应用此方法论,研究人员在特定设置中发现了正向和负向歧视的模式。这表明模型可能会根据提示词中的人口统计信息,对某些人口统计群体表现出偏好或偏见。
缓解策略与安全指南
虽然 Anthropic 明确表示,他们并不支持或允许将语言模型用于所研究的高风险用例进行自动化决策,但他们证明了通过仔细的提示词工程 (prompt engineering) 可以显著降低歧视。
提示词工程作为缓解工具
通过仔细的提示词工程可以减少正向和负向歧视。研究人员发现,在提示词中提供具体的指令或约束以确保公平性和中立性,可以带来更安全的结果。
部署考量
这项研究强调,模型的评估是一种主动措施,旨在确保随着 LM 能力的扩展,系统性偏见的问题得到解决。Anthropic 已通过 Hugging Face 向公众发布了其数据集和提示词,以促进对模型公平性的进一步研究。
对 AI 安全与政策的影响
这项工作为开发者和政策制定者提供了一条路径,用于预判、衡量并解决 AI 系统中的歧视问题。通过建立一种在广泛场景下改变人口统计信息的系统化方法,AI 社区可以朝着在社会应用中更公平地部署语言模型的方向迈进。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch