Hugging Face伦理与社会通讯 #3:伦理开放倡议
TL;DR
Hugging Face推出了一套伦理开放工具——六个高级伦理类别、社区标记功能、“Not For All Audiences”标签以及扩展的文档——以实现更安全、更具包容性的开源机器学习开发。
使命:开放且良好的机器学习
Hugging Face将其使命定义为让良好的机器学习(ML)民主化。开放式开发去中心化权力,使众多利益相关者能够根据多元价值塑造 AI。组织承认,开放性可能削弱直接的风险控制,尤其是当模型变得更强大并生成更广泛内容时。因此,Hugging Face强调需要强有力的审核、偏见检测和文档,以减轻往往对少数群体产生不成比例影响的危害。
伦理类别——六个高级标签
为了帮助用户查找并贡献伦理导向的机器学习工作,Hugging Face基于对社区提交的 Spaces 的分析,定义了六个无行话的类别:
- Rigorous – 强调最佳实践,如偏见与公平审计、隐私保护以及明确的限制披露。
- Consentful – 支持受技术影响的个人的自决(参见 Consentful Tech)。
- Socially Conscious – 突出推进社会、环境或科学目标的项目。
- Sustainable – 关注降低机器学习生态足迹的技术。
- Inclusive – 扩大构建和受益于机器学习系统的群体。
- Inquisitive – 照亮不平等和权力结构,促使社区重新思考与技术的关系。
这些标签会出现在相关仓库上,并会随社区反馈而演进。更多信息请访问 https://huggingface.co/ethics。
安全保障——风险缓解的工具与流程
Hugging Face拒绝“全有或全无”的开放发布方式。相反,它提供多种杠杆来控制机器学习产物的共享和再利用:
- Flagging Feature – 用户可以标记违反内容指南的模型、数据集、Spaces或讨论。标记图标出现在每个仓库页面;描述字段允许报告者提供上下文。
- Community Monitoring – 版主监督讨论板块,以执行平台行为准则。
- Enhanced Model Cards – 流行模型会获得涵盖社会影响、偏见、预期用途以及超出范围情形的详细文档。
- Audience‑Guiding Tags –
not-for-all-audiences标签会触发警告弹窗,允许观众在确认内容后选择观看。 - Responsible AI Licenses (RAIL) – Hugging Face推广针对如 BLOOM 和 BigCode 等模型的开放负责任 AI 许可证,使法律条款与伦理意图保持一致。
- Misuse Research – 持续的分析(例如 arXiv:2302.04844)识别出具有高度滥用潜力的模型和数据集。
标记工作流
- 在仓库页面点击标记图标。
- 提供对问题的详细说明。
- 报告会在仓库的社区标签页中开启对话,使报告者、仓库所有者和 Hugging Face 员工之间的交流透明化。
高风险标记的响应选项
- 降低在趋势推送中的可见度。
- 启用门控以限制访问(参见模型和数据集门控文档)。
- 将仓库设为私有。
- 完全禁用访问。
添加 “Not For All Audiences” 标签
- 编辑模型或数据集卡片。
- 将
not-for-all-audiences添加到tags字段。 - 提交 pull request;合并后,标签会出现在仓库页面上。
- 用户会看到带有查看内容选项的警告弹窗;可在内容偏好设置中调整偏好。
社区行动号召
Hugging Face邀请从事安全保障研究的学者在 Hub 上分享他们的工具。近期社区贡献包括:
- LLM Watermarking – 大型语言模型的水印演示(John Kirchenbauer 等,arXiv:2301.10226)。
- Model Card Generation Tool – 一个交互式工具,用于简化全面模型卡的创建。
- Photoguard – 用于图像篡改检测的安全保障。
这些示例说明开源贡献如何直接提升安全性和透明度。
本通讯由 Irene Solaiman、Giada Pistilli、Nima Boscarino、Yacine Jernite、Elizabeth Allendorf 和 Margaret Mitchell 代表伦理与社会团队撰写。