Hugging Face伦理与社会通讯 #3:伦理开放倡议

TL;DR

Hugging Face推出了一套伦理开放工具——六个高级伦理类别、社区标记功能、“Not For All Audiences”标签以及扩展的文档——以实现更安全、更具包容性的开源机器学习开发。


使命:开放且良好的机器学习

Hugging Face将其使命定义为让良好的机器学习(ML)民主化。开放式开发去中心化权力,使众多利益相关者能够根据多元价值塑造 AI。组织承认,开放性可能削弱直接的风险控制,尤其是当模型变得更强大并生成更广泛内容时。因此,Hugging Face强调需要强有力的审核、偏见检测和文档,以减轻往往对少数群体产生不成比例影响的危害。

伦理类别——六个高级标签

为了帮助用户查找并贡献伦理导向的机器学习工作,Hugging Face基于对社区提交的 Spaces 的分析,定义了六个无行话的类别:

  • Rigorous – 强调最佳实践,如偏见与公平审计、隐私保护以及明确的限制披露。
  • Consentful – 支持受技术影响的个人的自决(参见 Consentful Tech)。
  • Socially Conscious – 突出推进社会、环境或科学目标的项目。
  • Sustainable – 关注降低机器学习生态足迹的技术。
  • Inclusive – 扩大构建和受益于机器学习系统的群体。
  • Inquisitive – 照亮不平等和权力结构,促使社区重新思考与技术的关系。

这些标签会出现在相关仓库上,并会随社区反馈而演进。更多信息请访问 https://huggingface.co/ethics。

安全保障——风险缓解的工具与流程

Hugging Face拒绝“全有或全无”的开放发布方式。相反,它提供多种杠杆来控制机器学习产物的共享和再利用:

  1. Flagging Feature – 用户可以标记违反内容指南的模型、数据集、Spaces或讨论。标记图标出现在每个仓库页面;描述字段允许报告者提供上下文。
  2. Community Monitoring – 版主监督讨论板块,以执行平台行为准则。
  3. Enhanced Model Cards – 流行模型会获得涵盖社会影响、偏见、预期用途以及超出范围情形的详细文档。
  4. Audience‑Guiding Tagsnot-for-all-audiences 标签会触发警告弹窗,允许观众在确认内容后选择观看。
  5. Responsible AI Licenses (RAIL) – Hugging Face推广针对如 BLOOM 和 BigCode 等模型的开放负责任 AI 许可证,使法律条款与伦理意图保持一致。
  6. Misuse Research – 持续的分析(例如 arXiv:2302.04844)识别出具有高度滥用潜力的模型和数据集。

标记工作流

  • 在仓库页面点击标记图标。
  • 提供对问题的详细说明。
  • 报告会在仓库的社区标签页中开启对话,使报告者、仓库所有者和 Hugging Face 员工之间的交流透明化。

高风险标记的响应选项

  • 降低在趋势推送中的可见度。
  • 启用门控以限制访问(参见模型和数据集门控文档)。
  • 将仓库设为私有。
  • 完全禁用访问。

添加 “Not For All Audiences” 标签

  1. 编辑模型或数据集卡片。
  2. not-for-all-audiences 添加到 tags 字段。
  3. 提交 pull request;合并后,标签会出现在仓库页面上。
  4. 用户会看到带有查看内容选项的警告弹窗;可在内容偏好设置中调整偏好。

社区行动号召

Hugging Face邀请从事安全保障研究的学者在 Hub 上分享他们的工具。近期社区贡献包括:

  • LLM Watermarking – 大型语言模型的水印演示(John Kirchenbauer 等,arXiv:2301.10226)。
  • Model Card Generation Tool – 一个交互式工具,用于简化全面模型卡的创建。
  • Photoguard – 用于图像篡改检测的安全保障。

这些示例说明开源贡献如何直接提升安全性和透明度。


本通讯由 Irene Solaiman、Giada Pistilli、Nima Boscarino、Yacine Jernite、Elizabeth Allendorf 和 Margaret Mitchell 代表伦理与社会团队撰写。

Sources