OpenAI 評估 ChatGPT 公平性的研究摘要
TL;DR
OpenAI 發布了一項研究,顯示 ChatGPT 的回應在少於 0.1% 的情況下會因使用者名稱而出現有害刻板印象,且整體答案品質在性別與種族名稱提示下保持一致。此工作引入了一種使用 GPT‑4o 驅動的語言模型研究助理(LMRA)的隱私保護方法,來基準測試第一人稱公平性,未來將成為 OpenAI 模型評估套件的標準組成部分。
研究執行方式
回答: OpenAI 使用基於 GPT‑4o 的語言模型研究助理(LMRA)分析了數百萬條真實的 ChatGPT 對話記錄,且未暴露原始使用者資料。LMRA 評估名稱條件回應是否包含有害刻板印象,並將其判斷與人工評分者的結果進行比較。
- LMRA 檢視公開的聊天摘錄,這些摘錄在相同提示下使用不同使用者名稱(例如「John」與「Amanda」)。
- 對於每一對對話,LMRA 將回應分類為 有害刻板印象 或 無,然後在 9 個領域的 66 個任務以及 6 種模型變體中彙總結果。
- 使用人工評分者驗證 LMRA 的準確度;在性別相關判斷上,兩者的一致性超過 90%,但在種族/族裔刻板印象上較低。
主要發現
回答: 在所有受評模型中,ChatGPT 無論使用者名稱的性別或種族含義如何,都能提供同等高品質的答案,且有害刻板印象的出現率極低。
- 整體回應品質(正確性、幻覺率)在不同名稱組別間沒有可測量的差異。
- 有害刻板印象的案例約佔總回應的 0.1%;較舊的模型在特定領域有時會達到約 1%。
- 較長輸出的開放式任務(例如「寫一個故事」)較容易出現刻板印象,例如女性化的名稱會導致故事主角為女性。
- 模型偏見排名:GPT‑3.5 Turbo 表現出最高偏見;較新的模型(GPT‑4o‑mini 及之後的版本)在所有任務中均低於 1% 的門檻。
領域層級刻板印象率(由 LMRA 評估的 GPT‑4o‑mini)
| 領域 | 任務範例 | 有害刻板印象率 |
|---|---|---|
| 就業 | 職涯建議 | < 0.1 % |
| 商業與行銷 | 撰寫商業計畫 | < 0.1 % |
| 法律 | 起草法律文件 | < 0.1 % |
| 教育 | 解答數學問題 | < 0.1 % |
| 藝術 | 撰寫說唱歌曲 | < 0.1 % |
| 娛樂 | 撰寫故事 | < 0.1 % |
| 所有聊天(彙總) | — | < 0.1 % |
分析的限制
回答: 本研究的範圍僅限於英語文字互動、基於美國姓名的二元性別假設,以及四種種族/族裔類別(黑人、亞洲人、拉美裔、白人)。
- 並非所有使用者都會透露姓名;其他識別資訊也可能影響公平性。
- 此方法尚未涵蓋非文字模式(音訊),雖然相關的語音公平性工作已在 GPT‑4o 系統卡中提及。
- LMRA 在種族/族裔刻板印象上的與人工評分者的一致性較低,顯示自動偏見偵測仍有改進空間。
- 美國以外的文化背景與非英語語言仍未被檢視。
含意與後續步驟
回答: 將此測量管線納入標準評估工具組,OpenAI 能持續追蹤與降低偏見,為部署決策提供資訊並促進透明度。
- 基於 LMRA 的方法提供了一個可重現的第一人稱公平性基準,外部研究者亦可採用,因為 OpenAI 已公開使用的系統提示。
- 未來的工作將擴展至更多人口統計、語言與多模態輸入,旨在精煉「有害刻板印象」的定義並提升 LMRA 的準確度。
- 研究結果強化了較新模型世代在公平性上取得可衡量的進步,支持 OpenAI 更廣泛的安全與信任目標。
結論
OpenAI 的「評估 ChatGPT 公平性」研究顯示,基於名稱的偏見極為罕見(< 0.1 %),且回應品質在性別與種族名稱提示下保持一致。隱私保護的 LMRA 方法為第一人稱公平性評估樹立了新標準,將被納入未來模型評估,且已公開分享,以促進社群廣泛的研究與合作。
欲取得完整技術細節,請參閱原始公告中連結的論文。
Sources
- OriginalEvaluating fairness in ChatGPT