Hugging Face伦理与社会通讯 #2:机器学习中的偏见治理

Hugging Face发布了一份关于机器学习中偏见治理的综合指南,强调偏见是一个复杂的社会技术问题,单一的技术手段无法解决。核心要点是,机器偏见应被视为基于歧视的危害的风险因素,缓解工作需要在机器学习开发周期的每个阶段共同承担责任。

机器偏见作为社会危害的风险因素

机器偏见——系统编码负面刻板印象或在不同人群间表现出差异化性能的机制——可能放大已有的社会不平等。Hugging Face指出,自动化和规模化加剧这些问题的四种主要方式:

  1. 锁定行为: 技术可能将社会偏见冻结在特定时间点,阻碍社会进步。
  2. 传播有害行为: 偏见可能被导出到训练数据原始上下文之外。
  3. 放大不平等: 系统在进行预测时可能过度关注刻板关联。
  4. 剥夺救济渠道: 偏见可能隐藏在“黑箱”系统中,使受影响的个人难以寻求公正。

背景的作用

偏见并非模型的静态属性,而取决于部署的上下文。模型层面的机器偏见在某些应用中可能无关紧要,却在另一些情况下造成灾难性后果。例如,一个将职业场景与浅色肤色关联的文本到图像模型是一个风险因素,其表现为:

  • 在模型用于明确禁用人物的背景时无关紧要
  • 在用于维基百科的图库图片时放大刻板印象
  • 在警察部门用于生成嫌疑人素描时导致直接歧视

在机器学习开发周期中缓解偏见

由于偏见无处不在且复杂,Hugging Face建议采用多管齐下的方法,针对开发的三个关键阶段进行治理。

1. 任务定义

偏见的影响往往始于任务的定义方式以及所优化的目标。例如,仅以提升互动率为目标来优化推荐系统可能会降低媒体多样性,并锁定过去的刻板印象。

任务定义的建议:

  • 在引入机器学习之前,调查该领域的偏见报告。
  • 确定针对特定用例的高风险人口类别。
  • 检查优化目标是否强化偏见,并探索有利于多样性和长期正面影响的替代方案。

2. 数据集策划

数据集常常编码人类的刻板印象且缺乏代表性,导致性能差异。Hugging Face建议开发者思考数据的来源、所代表的人群以及策划过程。

数据集分析的关键工具:

  • Dataset Cards: 用于共享社会影响和偏见洞察的文档框架。
  • Disaggregators Library: 用于量化数据集组成以最小化代表性伤害的工具。
  • Data Measurements Tool: 使用归一化点互信息(nPMI)来揭示术语之间的刻板关联(例如,性别代词)。

3. 模型训练与选择

对模型进行偏见的记录与测量,使开发者能够为特定应用选择最安全的模型,或指导新模型的训练。

评估与可视化策略:

  • Model Cards: 用于伦理考量和分层评估的报告框架。
  • Output Visualization: 对生成模型而言,比较不同形容词和职业的输出有助于识别再现的刻板印象。对分类模型而言,类似 SEAL app 的工具可将相似错误分组,以识别导致性能差异的失效模式。
  • 定量基准: 使用 BOLD、HONEST 和 WinoBias 等基准评估语言模型的特定行为。
  • Evaluation on the Hub: 一款在大型模型上运行评估的工具,单个开发者使用时计算成本会极高。

Hugging Face偏见缓解工具概览

阶段 推荐工具
任务定义 ML Tasks directory, Task Exploration tool
数据集策划 Dataset Cards, Disaggregators library, Data Measurements Tool
模型开发 Model Cards, SEAL app, DiffusionBiasExplorer, Evaluation on the Hub, Bias Score Cards

Sources