Hugging Face伦理与社会通讯 #2:机器学习中的偏见治理
Hugging Face发布了一份关于机器学习中偏见治理的综合指南,强调偏见是一个复杂的社会技术问题,单一的技术手段无法解决。核心要点是,机器偏见应被视为基于歧视的危害的风险因素,缓解工作需要在机器学习开发周期的每个阶段共同承担责任。
机器偏见作为社会危害的风险因素
机器偏见——系统编码负面刻板印象或在不同人群间表现出差异化性能的机制——可能放大已有的社会不平等。Hugging Face指出,自动化和规模化加剧这些问题的四种主要方式:
- 锁定行为: 技术可能将社会偏见冻结在特定时间点,阻碍社会进步。
- 传播有害行为: 偏见可能被导出到训练数据原始上下文之外。
- 放大不平等: 系统在进行预测时可能过度关注刻板关联。
- 剥夺救济渠道: 偏见可能隐藏在“黑箱”系统中,使受影响的个人难以寻求公正。
背景的作用
偏见并非模型的静态属性,而取决于部署的上下文。模型层面的机器偏见在某些应用中可能无关紧要,却在另一些情况下造成灾难性后果。例如,一个将职业场景与浅色肤色关联的文本到图像模型是一个风险因素,其表现为:
- 在模型用于明确禁用人物的背景时无关紧要。
- 在用于维基百科的图库图片时放大刻板印象。
- 在警察部门用于生成嫌疑人素描时导致直接歧视。
在机器学习开发周期中缓解偏见
由于偏见无处不在且复杂,Hugging Face建议采用多管齐下的方法,针对开发的三个关键阶段进行治理。
1. 任务定义
偏见的影响往往始于任务的定义方式以及所优化的目标。例如,仅以提升互动率为目标来优化推荐系统可能会降低媒体多样性,并锁定过去的刻板印象。
任务定义的建议:
- 在引入机器学习之前,调查该领域的偏见报告。
- 确定针对特定用例的高风险人口类别。
- 检查优化目标是否强化偏见,并探索有利于多样性和长期正面影响的替代方案。
2. 数据集策划
数据集常常编码人类的刻板印象且缺乏代表性,导致性能差异。Hugging Face建议开发者思考数据的来源、所代表的人群以及策划过程。
数据集分析的关键工具:
- Dataset Cards: 用于共享社会影响和偏见洞察的文档框架。
- Disaggregators Library: 用于量化数据集组成以最小化代表性伤害的工具。
- Data Measurements Tool: 使用归一化点互信息(nPMI)来揭示术语之间的刻板关联(例如,性别代词)。
3. 模型训练与选择
对模型进行偏见的记录与测量,使开发者能够为特定应用选择最安全的模型,或指导新模型的训练。
评估与可视化策略:
- Model Cards: 用于伦理考量和分层评估的报告框架。
- Output Visualization: 对生成模型而言,比较不同形容词和职业的输出有助于识别再现的刻板印象。对分类模型而言,类似 SEAL app 的工具可将相似错误分组,以识别导致性能差异的失效模式。
- 定量基准: 使用 BOLD、HONEST 和 WinoBias 等基准评估语言模型的特定行为。
- Evaluation on the Hub: 一款在大型模型上运行评估的工具,单个开发者使用时计算成本会极高。
Hugging Face偏见缓解工具概览
| 阶段 | 推荐工具 |
|---|---|
| 任务定义 | ML Tasks directory, Task Exploration tool |
| 数据集策划 | Dataset Cards, Disaggregators library, Data Measurements Tool |
| 模型开发 | Model Cards, SEAL app, DiffusionBiasExplorer, Evaluation on the Hub, Bias Score Cards |