Hugging Face Ethics and Society Newsletter 第4期:文本到图像模型中的偏见

Hugging Face 已经识别出改进评估方法以检测和解决文本到图像(TTI)模型偏见的紧迫需求。由于这些模型在各种社会技术环境中的部署日益增加,它们可能会放大现有的社会不平等和文化刻板印象。

文本到图像系统中的偏见来源

TTI 模型中的偏见并非单一故障的结果,而是机器学习管道多个阶段共同作用的结果。Hugging Face 确定了五个主要来源:

  • 训练数据: 流行的多模态数据集(如 LAION-5B、MS-COCO 和 VQA v2.0)包含有害的关联和偏见。例如,Stable Bias 项目指出图像生成中缺乏多样性,并延续了身份群体刻板印象,例如 Dall-E 2 生成的首席执行官和经理缺乏多样性。
  • 预训练数据过滤: 旨在清理数据集的过滤过程可能会无意中放大偏见。OpenAI 报告称,对 Dall-E 2 的训练数据进行过滤可能会增加偏见,这可能是因为现有数据集倾向于将女性置于性化情境中。
  • 推理(CLIP 模型): 如 Stable Diffusion 和 Dall-E 2 等模型依赖 CLIP 模型进行提示编码。CLIP 在种族、性别和年龄方面有已记录的偏见,通常在提示未明确指定时将“白人、中年、男性”视为默认。
  • 潜在空间: 模型的潜在空间内部结构可能反映偏见。虽然一些工作(例如 Fair Diffusion)探索沿着性别等轴引导生成以改善表示,但仍需要更多研究来理解潜在空间如何影响输出。
  • 事后过滤: 内置安全过滤器往往缺乏鲁棒性。对 Stable Diffusion 安全过滤器的红队测试显示,虽然它能有效识别性内容,但经常未能标记暴力、血腥或令人不安的内容。

偏见检测的技术方法

解决偏见是一个社会技术挑战,不能仅靠技术来解决。Hugging Face 建议结合以下方法来深入了解模型的局限性:

探索工具

作为 Stable Bias 项目的一部分,Hugging Face 开发了用于可视化和跨模型比较偏见的工具:

  • 平均扩散面部: 该工具计算特定职业(例如“清洁工”)的平均表示,以比较不同模型(如 Stable Diffusion v1.4、v2 和 Dall-E 2)如何可视化该角色。
  • 面部聚类和色彩专业探索器: 这些工具允许用户在不依赖预定义标签的情况下识别生成数据中的模式和刻板印象。

红队测试

红队测试通过提示对模型进行压力测试,以发现漏洞和偏见。Hugging Face 指出此过程目前是临时的,缺乏系统的基准或排行榜。目前,唯一主要的开源红队测试提示资源是 Anthropic 的数据集,仅限于英文自然语言文本。

文档和评估

为了标准化偏见的报告,Hugging Face 主张使用模型卡、数据表和 README。通过将红队测试和探索工具的结果与模型权重一起共享,创建者可以提供关于模型已知偏见的透明度。

价值对齐的挑战

除了检测之外,Hugging Face 提出了一个伦理困境:模型是应该仅仅模仿数据,还是积极推广一个特定版本的“理想”社会。这种方法引入了“谁的价值观”被编程的问题,因为价值观在不同文化和个体之间有所差异。

这些偏见的影响也高度依赖于下游应用:

  • 低风险: 在人机交互的环境中,如平面设计(例如 RunwayML),用户可以通过调整提示手动纠正偏见。
  • 高风险: 在高风险环境中,例如使用 Dall-E 2 为法医艺术家创建警察素描时,偏见可能会强化危险的种族和社会刻板印象。

伦理与社会的其他更新

  • 内容政策: Hugging Face 更新了其内容政策,以强调 同意 作为核心价值。
  • AI 责任政策: Hugging Face 提交了对 NTIA 关于 AI 责任的征求意见的回应,强调了透明度、文档和开放协作的必要性。

Sources