使用 🤗 Evaluate 評估語言模型偏見

TL;DR

Hugging Face 在 🤗 Evaluate 函式庫中推出了新的偏見評估指標——toxicitylanguage polarity(Regard)HONEST,讓研究人員能夠量化因果語言模型(如 GPT‑2 與 BLOOM)所產生的有害或刻板印象輸出。

新偏見評估工作流程概述

偏見評估工作流程包含兩個步驟:

  1. Prompting(提示)因果語言模型(CLM)使用預先定義的提示集合,該集合託管於 🤗 Datasets。
  2. Scoring(評分)使用 🤗 Evaluate 中的指標對生成的完成句子進行評分。 此方法適用於任何能產生自由文字的 CLM,且不依賴特定的提示資料集。

毒性測量

要點: 僅僅改變代名詞即可使測得的毒性比例翻倍,顯示模型完成句子中的性別偏見。

  • 使用的資料集:WinoBias 資料集提取的提示。
  • 模型: GPT‑2 為男性代名詞與女性代名詞的提示生成完成句子。
  • 指標: toxicity 測量,封裝了 Facebook 的 R4 仇恨言論分類器。
  • 結果範例:
    {"toxicity_ratio": 0.0}   // male prompts
    {"toxicity_ratio": 0.333} // female prompts
    
    女性代名詞的完成句子包含較高比例的有毒輸出。
  • 使用方式: 使用 evaluate.load("toxicity") 載入指標,並呼叫 compute(predictions=..., aggregation="ratio")。若省略 aggregation,會返回每個完成句子的原始分數(例如 0.0002 與 0.85)。
  • 注意事項: 高毒性分數可能包含觸發性語言;使用者應負責任地處理此類內容。

語言極性(Regard)測量

要點: 模型對 CEO 提示的完成句子呈現較正面的極性,較之對卡車司機提示的完成句子,顯示職業偏見。

  • 使用的資料集: BOLD 資料集的子集,該資料集包含針對各種人口群體的提示。
  • 模型: GPT‑2 為兩個職業群體(卡車司機與 CEO)生成完成句子。
  • 指標: regard 測量(使用 evaluate.load("regard", "compare") 載入)。它返回 negativeneutralotherpositive 四種極性的分佈。
  • 結果範例:
    {"negative": 0.14, "neutral": 0.29, "other": -0.11, "positive": -0.32}
    
    CEO 完成句子的正面分數較高,表示對該職業持較為正面的看法。
  • 解讀: 透過計算不同群體之間的 regard 分數差異,實務者可揭露對特定身份的系統性偏好或貶低。

有害句子完成(HONEST)

要點: HONEST 指標對 lesbian 提示的完成句子標記出較多有害內容,較之 gay 提示,顯示性別與性取向偏見。

  • 使用的資料集: HONEST 提示集(針對 LGBTQAI+ 群體的英文範本)。
  • 模型: GPT‑2 為針對「lesbian」與「gay」群體的提示生成完成句子。
  • 指標: honest 測量,使用 evaluate.load("honest", "en") 載入。
  • 結果範例:
    {"honest_score_per_group": {"lesbian": 0.333, "gay": 0.0}}
    
    分數越高表示有害完成句子越多;lesbian 群體的分數較高。
  • 彈性: 使用者可調整 top‑k 抽樣參數,以探索不同數量的備選完成句子對 HONEST 分數的影響,正如原始 HONEST 論文所示。

討論與限制

要點: 現有的偏見資料集範圍有限,且常將複雜的身份簡化為二元或類別標籤;應同時使用多種互補的指標。

  • Hugging Face 鼓勵社群貢獻更多資料集,以涵蓋如能力狀態、年齡等未被充分代表的面向。
  • 部落格強調,基於現有資料集的偏見評估不應被視為完整的真相;它們僅提供模型行為的部分觀點。
  • 結合 toxicity、regard 與 HONEST 分數,可更全面地檢視模型在不同社會層面的適切性。

致謝

作者感謝 Federico Bianchi、Jwala Dhamala、Sam Gehman、Rahul Gupta、Suchin Gururangan、Varun Kumar、Kyle Lo、Debora Nozza 與 Emily Sheng,感謝他們對將資料集與評估腳本加入 🤗 Evaluate 與 Datasets 函式庫的貢獻。

Sources