使用 🤗 Evaluate 評估語言模型偏見
TL;DR
Hugging Face 在 🤗 Evaluate 函式庫中推出了新的偏見評估指標——toxicity、language polarity(Regard) 與 HONEST,讓研究人員能夠量化因果語言模型(如 GPT‑2 與 BLOOM)所產生的有害或刻板印象輸出。
新偏見評估工作流程概述
偏見評估工作流程包含兩個步驟:
- Prompting(提示)因果語言模型(CLM)使用預先定義的提示集合,該集合託管於 🤗 Datasets。
- Scoring(評分)使用 🤗 Evaluate 中的指標對生成的完成句子進行評分。 此方法適用於任何能產生自由文字的 CLM,且不依賴特定的提示資料集。
毒性測量
要點: 僅僅改變代名詞即可使測得的毒性比例翻倍,顯示模型完成句子中的性別偏見。
- 使用的資料集: 從 WinoBias 資料集提取的提示。
- 模型: GPT‑2 為男性代名詞與女性代名詞的提示生成完成句子。
- 指標:
toxicity測量,封裝了 Facebook 的 R4 仇恨言論分類器。 - 結果範例:
女性代名詞的完成句子包含較高比例的有毒輸出。{"toxicity_ratio": 0.0} // male prompts {"toxicity_ratio": 0.333} // female prompts - 使用方式: 使用
evaluate.load("toxicity")載入指標,並呼叫compute(predictions=..., aggregation="ratio")。若省略aggregation,會返回每個完成句子的原始分數(例如 0.0002 與 0.85)。 - 注意事項: 高毒性分數可能包含觸發性語言;使用者應負責任地處理此類內容。
語言極性(Regard)測量
要點: 模型對 CEO 提示的完成句子呈現較正面的極性,較之對卡車司機提示的完成句子,顯示職業偏見。
- 使用的資料集: BOLD 資料集的子集,該資料集包含針對各種人口群體的提示。
- 模型: GPT‑2 為兩個職業群體(卡車司機與 CEO)生成完成句子。
- 指標:
regard測量(使用evaluate.load("regard", "compare")載入)。它返回 negative、neutral、other 與 positive 四種極性的分佈。 - 結果範例:
CEO 完成句子的正面分數較高,表示對該職業持較為正面的看法。{"negative": 0.14, "neutral": 0.29, "other": -0.11, "positive": -0.32} - 解讀: 透過計算不同群體之間的 regard 分數差異,實務者可揭露對特定身份的系統性偏好或貶低。
有害句子完成(HONEST)
要點: HONEST 指標對 lesbian 提示的完成句子標記出較多有害內容,較之 gay 提示,顯示性別與性取向偏見。
- 使用的資料集: HONEST 提示集(針對 LGBTQAI+ 群體的英文範本)。
- 模型: GPT‑2 為針對「lesbian」與「gay」群體的提示生成完成句子。
- 指標:
honest測量,使用evaluate.load("honest", "en")載入。 - 結果範例:
分數越高表示有害完成句子越多;lesbian 群體的分數較高。{"honest_score_per_group": {"lesbian": 0.333, "gay": 0.0}} - 彈性: 使用者可調整
top‑k抽樣參數,以探索不同數量的備選完成句子對 HONEST 分數的影響,正如原始 HONEST 論文所示。
討論與限制
要點: 現有的偏見資料集範圍有限,且常將複雜的身份簡化為二元或類別標籤;應同時使用多種互補的指標。
- Hugging Face 鼓勵社群貢獻更多資料集,以涵蓋如能力狀態、年齡等未被充分代表的面向。
- 部落格強調,基於現有資料集的偏見評估不應被視為完整的真相;它們僅提供模型行為的部分觀點。
- 結合 toxicity、regard 與 HONEST 分數,可更全面地檢視模型在不同社會層面的適切性。
致謝
作者感謝 Federico Bianchi、Jwala Dhamala、Sam Gehman、Rahul Gupta、Suchin Gururangan、Varun Kumar、Kyle Lo、Debora Nozza 與 Emily Sheng,感謝他們對將資料集與評估腳本加入 🤗 Evaluate 與 Datasets 函式庫的貢獻。