Hugging Face 倫理與社會通訊 #2:解決機器學習中的偏見
Hugging Face 發布了一份關於解決機器學習偏見的完整指南,強調偏見是一個複雜的社會技術議題,無法僅靠單一技術介入解決。核心要點是,機器偏見應被視為歧視性傷害的風險因素,減緩這些偏見需要在機器學習開發週期的每個階段共同負起責任。
機器偏見作為社會傷害的風險因素
機器偏見——系統編碼負面刻板印象或在不同族群間表現出差異的機制——可能放大現有的社會不平等。Hugging Face 確認了自動化與規模化加劇此問題的四種主要方式:
- 鎖定行為: 技術可能將社會偏見凍結在時間裡,阻礙社會進步。
- 散播有害行為: 偏見可能被輸出到訓練資料原始情境之外。
- 放大不平等: 系統在做預測時可能過度聚焦於刻板印象的關聯。
- 剝奪補救機會: 偏見可能隱藏於「黑箱」系統中,使受影響者難以尋求正義。
情境的角色
偏見不是模型的靜態屬性,而是取決於部署情境。模型層面的機器偏見在某些應用中可能無關緊要,但在其他情境下卻可能造成災難性後果。例如,一個將專業環境與淺色膚色關聯的文字轉圖像模型,其風險因素如下:
- 若模型用於明確禁用人物的背景,則無關緊要。
- 若用於 Wikipedia 的庫存圖片,則放大刻板印象。
- 若警察單位使用該模型生成嫌疑人素描,則直接造成歧視。
在機器學習開發週期中減緩偏見
因為偏見普遍且複雜,Hugging Face 建議採取多管齊下的方式,針對開發的三個關鍵階段進行介入。
1. 任務定義
偏見的影響往往始於任務的框架與優化目標。例如,僅以互動率為唯一指標優化推薦系統,可能降低媒體多樣性並固化過去的刻板印象。
任務定義的建議:
- 在引入機器學習前,調查該領域已有的偏見報告。
- 確認使用案例中可能受影響的特定人口類別。
- 檢視優化目標是否強化偏見,並探索有助於多樣性與長期正向影響的替代方案。
2. 資料集策展
資料集常常編碼人類的刻板印象且缺乏代表性,導致表現差異。Hugging Face 建議開發者思考資料的來源、所代表的人群以及策展流程。
資料集分析的關鍵工具:
- Dataset Cards:用於分享社會影響與偏見洞見的文件框架。
- Disaggregators Library:量化資料集組成以最小化代表性傷害的工具。
- Data Measurements Tool:利用正規化點對點互資訊 (nPMI) 揭示詞彙間的刻板印象關聯(例如性別代名詞)。
3. 模型訓練與選擇
記錄與衡量模型中的偏見,使開發者能為特定應用選擇最安全的模型,或指導新模型的訓練。
評估與視覺化策略:
- Model Cards:用於報告倫理考量與分群評估的框架。
- Output Visualization:對生成式模型而言,比較不同形容詞與職業的輸出有助於發現被複製的刻板印象;對分類模型而言,使用 SEAL app 將相似錯誤分組,可辨識導致表現差異的失效模式。
- Quantitative Benchmarks:使用 BOLD、HONEST、WinoBias 等基準評估語言模型的目標行為。
- Evaluation on the Hub:一個在大型模型上執行評估的工具,對個別開發者而言可避免巨大的計算成本。
Hugging Face 偏見緩解工具彙總
| 階段 | 推薦工具 |
|---|---|
| 任務定義 | ML Tasks 目錄、Task Exploration 工具 |
| 資料集策展 | Dataset Cards、Disaggregators library、Data Measurements Tool |
| 模型開發 | Model Cards、SEAL app、DiffusionBiasExplorer、Evaluation on the Hub、Bias Score Cards |