Hugging Face 倫理與社會通訊 #4:文字生成圖像模型中的偏見

Hugging Face 已發現,對於改進評估方法以檢測並解決文字生成圖像 (TTI) 模型中的偏見,存在著迫切的需求。由於這些模型越來越多地被部署在多樣化的社會技術情境中,它們面臨著放大既有社會不平等和文化刻板印象的風險。

文字生成圖像系統中的偏見來源

TTI 模型中的偏見並非單一錯誤的結果,而是從機器學習流程的多個階段中產生的。Hugging Face 識別出五個主要的來源:

  • 訓練數據: 熱門的多模態數據集(例如 LAION-5B、MS-COCO 和 VQA v2.0)包含有害的關聯和偏見。例如,Stable Bias 專案指出圖像生成缺乏多樣性,並持續強化身份群體的刻板印象,例如 Dall-E 2 生成的執行長和經理缺乏多樣性。
  • 預訓練數據過濾: 旨在清理數據集的過濾過程可能會在無意中放大偏見。OpenAI 報告指出,為 Dall-E 2 過濾訓練數據可能會增加偏見,這可能是由於現有數據集傾向於在性化情境中呈現女性。
  • 推理 (CLIP 模型): 像 Stable Diffusion 和 Dall-E 2 這樣的模型依賴 CLIP 模型進行提示詞編碼。CLIP 在種族、性別和年齡方面已有文獻記載的偏見,當提示詞描述不夠明確時,通常會將「白人、中年、男性」視為預設值。
  • 潛在空間 (Latent Space): 模型潛在空間的內部結構可能反映偏見。雖然有些研究(例如 Fair Diffusion)正在探索沿著性別等軸線引導生成以改善代表性,但仍需要更多研究來理解潛在空間如何影響輸出。
  • 事後過濾 (Post-hoc Filtering): 內建的安全過濾器通常缺乏魯棒性。對 Stable Diffusion 安全過濾器的紅隊演練 (Red-teaming) 顯示,雖然它能有效識別色情內容,但往往無法標記暴力、血腥或令人不安的內容。

偏見檢測的技術方法

解決偏見是一個社會技術挑戰,無法僅靠技術解決。Hugging Face 建議結合使用以下方法來深入了解模型的局限性:

探索工具

作為 Stable Bias 專案的一部分,Hugging Face 開發了用於視覺化並比較不同模型間偏見的工具:

  • Average Diffusion Faces: 此工具計算特定職業(例如「清潔工」)的平均表示,以比較不同模型(如 Stable Diffusion v1.4、v2 和 Dall-E 2)如何視覺化該角色。
  • Face Clustering and Colorfulness Profession Explorer: 這些工具允許用戶在不依賴預定義標籤的情況下,識別生成數據中的模式和刻板印象。

紅隊演練 (Red-Teaming)

紅隊演練涉及透過提示詞對模型進行壓力測試,以發現漏洞和偏見。Hugging Face 指出,目前的這一過程是隨機的,缺乏系統性的基準測試或排行榜。目前,唯一主要的開源紅隊演練提示詞資源是 Anthropic 的數據集,但該數據集僅限於英語自然語言文本。

記錄與評估

為了規範偏見的報告,Hugging Face 提倡使用模型卡 (model cards)、數據表 (datasheets) 和 README。透過在分享模型權重時同時分享紅隊演練和探索工具的結果,創作者可以提供有關模型已知偏見的透明度。

價值對齊的挑戰

除了檢測之外,Hugging Face 還提出了倫理困境:模型應該僅僅模仿數據,還是應該積極推廣某種特定版本的「理想」社會?這種方法引入了「誰的價值觀」正在被編寫的問題,因為價值觀因文化和個人而異。

這些偏見的影響也很大程度上取決於下游應用:

  • 低風險: 在人機協作 (human-in-the-loop) 的設定中,如平面設計 (例如 RunwayML),用戶可以透過調整提示詞來手動修正偏見。
  • 高風險: 在高風險環境中,例如使用 Dall-E 2 為鑑識藝術家製作警方素描,偏見可能會強化危險的種族和社會刻板印象。

其他倫理與社會更新

  • 內容政策: Hugging Face 更新了其內容政策,強調將「知情同意」作為核心價值。
  • AI 問責政策: Hugging Face 向 NTIA 提交了關於 AI 問責的意見徵詢回應,強調了透明度、記錄和開放協作的必要性。

Sources