降低偏见并提升 DALL·E 2 的安全性
OpenAI 为 DALL·E 2 引入了一项新的系统级技术,以确保生成的人物图像更准确地反映全球人口的多样性。此更新解决了训练数据中的偏见,并加强了安全协议,以防止创建欺骗性内容和公众人物的肖像。
改善代表性和多样性
DALL·E 2 现在采用一种缓解技术,当用户提供描述人物但未指定种族或性别的提示时(例如,“消防员”),该技术会被触发。此系统级干预旨在降低模型默认使用狭隘刻板印象的可能性。
内部评估表明该技术非常有效:在应用缓解措施后,用户报告 DALL·E 图像包含多元背景人物的可能性提升了 12 倍。
安全系统增强
在 2022 年 4 月启动的研究预览阶段之后,OpenAI 根据早期用户标记的敏感和偏见图像的反馈,实施了多项安全更新。这些改进包括:
欺骗性内容和公众人物
为了最大限度降低用于创建欺骗性内容的滥用风险,DALL·E 2 现在会拒绝:
- 包含真实面孔的图片上传。
- 尝试生成公众人物的肖像,包括知名政治人物和名人。
内容过滤与监控
OpenAI 已优化其安全基础设施,以更好地平衡创意表达与政策执行:
- Improved Accuracy: 内容过滤器已更新,能够更有效地阻止违反 OpenAI 内容政策的提示和图片上传。
- Enhanced Monitoring: 自动化和人工监控系统均已改进,以更好地防止系统被滥用。
部署策略
OpenAI 正在扩大 DALL·E 2 的访问范围,以实施负责任的部署策略。实验室表示,扩大用户基数使他们能够更好地了解真实世界的使用模式,从而实现对安全系统的持续迭代,并更深入地理解 AI 系统如何反映其训练数据中存在的偏见。