OpenAI 評估 ChatGPT 公平性的研究摘要

TL;DR

OpenAI 發布了一項研究,顯示 ChatGPT 的回應在少於 0.1% 的情況下會因使用者名稱而出現有害刻板印象,且整體答案品質在性別與種族名稱提示下保持一致。此工作引入了一種使用 GPT‑4o 驅動的語言模型研究助理(LMRA)的隱私保護方法,來基準測試第一人稱公平性,未來將成為 OpenAI 模型評估套件的標準組成部分。

研究執行方式

回答: OpenAI 使用基於 GPT‑4o 的語言模型研究助理(LMRA)分析了數百萬條真實的 ChatGPT 對話記錄,且未暴露原始使用者資料。LMRA 評估名稱條件回應是否包含有害刻板印象,並將其判斷與人工評分者的結果進行比較。

  • LMRA 檢視公開的聊天摘錄,這些摘錄在相同提示下使用不同使用者名稱(例如「John」與「Amanda」)。
  • 對於每一對對話,LMRA 將回應分類為 有害刻板印象,然後在 9 個領域的 66 個任務以及 6 種模型變體中彙總結果。
  • 使用人工評分者驗證 LMRA 的準確度;在性別相關判斷上,兩者的一致性超過 90%,但在種族/族裔刻板印象上較低。

主要發現

回答: 在所有受評模型中,ChatGPT 無論使用者名稱的性別或種族含義如何,都能提供同等高品質的答案,且有害刻板印象的出現率極低。

  • 整體回應品質(正確性、幻覺率)在不同名稱組別間沒有可測量的差異。
  • 有害刻板印象的案例約佔總回應的 0.1%;較舊的模型在特定領域有時會達到約 1%。
  • 較長輸出的開放式任務(例如「寫一個故事」)較容易出現刻板印象,例如女性化的名稱會導致故事主角為女性。
  • 模型偏見排名:GPT‑3.5 Turbo 表現出最高偏見;較新的模型(GPT‑4o‑mini 及之後的版本)在所有任務中均低於 1% 的門檻。

領域層級刻板印象率(由 LMRA 評估的 GPT‑4o‑mini)

領域 任務範例 有害刻板印象率
就業 職涯建議 < 0.1 %
商業與行銷 撰寫商業計畫 < 0.1 %
法律 起草法律文件 < 0.1 %
教育 解答數學問題 < 0.1 %
藝術 撰寫說唱歌曲 < 0.1 %
娛樂 撰寫故事 < 0.1 %
所有聊天(彙總) < 0.1 %

分析的限制

回答: 本研究的範圍僅限於英語文字互動、基於美國姓名的二元性別假設,以及四種種族/族裔類別(黑人、亞洲人、拉美裔、白人)。

  • 並非所有使用者都會透露姓名;其他識別資訊也可能影響公平性。
  • 此方法尚未涵蓋非文字模式(音訊),雖然相關的語音公平性工作已在 GPT‑4o 系統卡中提及。
  • LMRA 在種族/族裔刻板印象上的與人工評分者的一致性較低,顯示自動偏見偵測仍有改進空間。
  • 美國以外的文化背景與非英語語言仍未被檢視。

含意與後續步驟

回答: 將此測量管線納入標準評估工具組,OpenAI 能持續追蹤與降低偏見,為部署決策提供資訊並促進透明度。

  • 基於 LMRA 的方法提供了一個可重現的第一人稱公平性基準,外部研究者亦可採用,因為 OpenAI 已公開使用的系統提示。
  • 未來的工作將擴展至更多人口統計、語言與多模態輸入,旨在精煉「有害刻板印象」的定義並提升 LMRA 的準確度。
  • 研究結果強化了較新模型世代在公平性上取得可衡量的進步,支持 OpenAI 更廣泛的安全與信任目標。

結論

OpenAI 的「評估 ChatGPT 公平性」研究顯示,基於名稱的偏見極為罕見(< 0.1 %),且回應品質在性別與種族名稱提示下保持一致。隱私保護的 LMRA 方法為第一人稱公平性評估樹立了新標準,將被納入未來模型評估,且已公開分享,以促進社群廣泛的研究與合作。


欲取得完整技術細節,請參閱原始公告中連結的論文。

Sources