Hugging Face 倫理與社會通訊 #2:解決機器學習中的偏見

Hugging Face 發布了一份關於解決機器學習偏見的完整指南,強調偏見是一個複雜的社會技術議題,無法僅靠單一技術介入解決。核心要點是,機器偏見應被視為歧視性傷害的風險因素,減緩這些偏見需要在機器學習開發週期的每個階段共同負起責任。

機器偏見作為社會傷害的風險因素

機器偏見——系統編碼負面刻板印象或在不同族群間表現出差異的機制——可能放大現有的社會不平等。Hugging Face 確認了自動化與規模化加劇此問題的四種主要方式:

  1. 鎖定行為: 技術可能將社會偏見凍結在時間裡,阻礙社會進步。
  2. 散播有害行為: 偏見可能被輸出到訓練資料原始情境之外。
  3. 放大不平等: 系統在做預測時可能過度聚焦於刻板印象的關聯。
  4. 剝奪補救機會: 偏見可能隱藏於「黑箱」系統中,使受影響者難以尋求正義。

情境的角色

偏見不是模型的靜態屬性,而是取決於部署情境。模型層面的機器偏見在某些應用中可能無關緊要,但在其他情境下卻可能造成災難性後果。例如,一個將專業環境與淺色膚色關聯的文字轉圖像模型,其風險因素如下:

  • 若模型用於明確禁用人物的背景,則無關緊要
  • 若用於 Wikipedia 的庫存圖片,則放大刻板印象
  • 若警察單位使用該模型生成嫌疑人素描,則直接造成歧視

在機器學習開發週期中減緩偏見

因為偏見普遍且複雜,Hugging Face 建議採取多管齊下的方式,針對開發的三個關鍵階段進行介入。

1. 任務定義

偏見的影響往往始於任務的框架與優化目標。例如,僅以互動率為唯一指標優化推薦系統,可能降低媒體多樣性並固化過去的刻板印象。

任務定義的建議:

  • 在引入機器學習前,調查該領域已有的偏見報告。
  • 確認使用案例中可能受影響的特定人口類別。
  • 檢視優化目標是否強化偏見,並探索有助於多樣性與長期正向影響的替代方案。

2. 資料集策展

資料集常常編碼人類的刻板印象且缺乏代表性,導致表現差異。Hugging Face 建議開發者思考資料的來源、所代表的人群以及策展流程。

資料集分析的關鍵工具:

  • Dataset Cards:用於分享社會影響與偏見洞見的文件框架。
  • Disaggregators Library:量化資料集組成以最小化代表性傷害的工具。
  • Data Measurements Tool:利用正規化點對點互資訊 (nPMI) 揭示詞彙間的刻板印象關聯(例如性別代名詞)。

3. 模型訓練與選擇

記錄與衡量模型中的偏見,使開發者能為特定應用選擇最安全的模型,或指導新模型的訓練。

評估與視覺化策略:

  • Model Cards:用於報告倫理考量與分群評估的框架。
  • Output Visualization:對生成式模型而言,比較不同形容詞與職業的輸出有助於發現被複製的刻板印象;對分類模型而言,使用 SEAL app 將相似錯誤分組,可辨識導致表現差異的失效模式。
  • Quantitative Benchmarks:使用 BOLD、HONEST、WinoBias 等基準評估語言模型的目標行為。
  • Evaluation on the Hub:一個在大型模型上執行評估的工具,對個別開發者而言可避免巨大的計算成本。

Hugging Face 偏見緩解工具彙總

階段 推薦工具
任務定義 ML Tasks 目錄、Task Exploration 工具
資料集策展 Dataset Cards、Disaggregators library、Data Measurements Tool
模型開發 Model Cards、SEAL app、DiffusionBiasExplorer、Evaluation on the Hub、Bias Score Cards

Sources