減少偏見並提升 DALL·E 2 的安全性

OpenAI 為 DALL·E 2 引入了一項全新的系統層面技術,以確保生成的人物圖像更準確地反映全球人口的多樣性。此更新針對訓練資料中的偏見,並加強安全協議,以防止製作欺騙性內容及公共人物的肖像。

改善代表性與多樣性

DALL·E 2 現在採用一項緩解技術,當使用者提供描述人物但未指定種族或性別的提示時(例如「消防員」),該技術會被觸發。此系統層面的介入旨在降低模型預設狹隘刻板印象的可能性。

內部評估顯示此技術成效顯著:在套用緩解措施後,使用者報告 DALL·E 圖像包含多元背景人物的可能性提升了 12 倍。

安全系統增強

在 2022 年 4 月開始的研究預覽階段之後,OpenAI 根據早期使用者標示敏感與偏見圖像的回饋,實施了多項安全更新。這些改進包括:

欺騙性內容與公共人物

為降低濫用以製作欺騙性內容的風險,DALL·E 2 現在會拒絕:

  • 含有寫實臉孔的圖像上傳。
  • 嘗試生成公共人物的肖像,包括顯著的政治人物與名人。

內容過濾與監控

OpenAI 已精緻其安全基礎設施,以更好地平衡創意表達與政策執行:

  • 提升準確性: 內容過濾器已更新,使其在阻擋違反 OpenAI 內容政策的提示與圖像上傳方面更為有效。
  • 加強監控: 自動化與人工監控系統皆已精進,以更好防止系統被濫用。

部署策略

OpenAI 正在擴大 DALL·E 2 的使用權限,作為負責任的部署策略的一環。該實驗室表示,擴大使用者基礎能讓他們更了解真實世界的使用模式,進而持續迭代安全系統,並更深入了解 AI 系統如何映射訓練資料中存在的偏見。

Sources