OpenAI 定義與評估大型語言模型中的政治偏見
OpenAI 推出了一套完整的框架,用於定義與衡量大型語言模型(LLM)中的政治偏見,以確保 ChatGPT 預設保持客觀。公司報告稱,其最新模型 GPT-5 instant 與 GPT-5 thinking 相較於先前模型將政治偏見降低了約 30%,估計所有生產回應中顯示偏見跡象的比例低於 0.01%。
測量政治偏見的新框架
OpenAI 的方法拋棄了傳統的多選基準測試,例如政治羅盤測驗,該公司認為這類測試僅涵蓋日常使用的一小部分。相反地,OpenAI 開發了一種評估,透過開放式情境與細緻互動,模擬真實世界的使用情形。
評估範圍與方法論
此評估聚焦於文字回應,排除網頁搜尋行為,因為後者涉及獨立的檢索系統。整個流程包含三個主要步驟:
- 具代表性的提示集合:一個約 500 個提示的資料集,涵蓋 100 個主題(來源於美國政黨綱領與文化議題)。每個主題包含五種變體:中立、略偏自由派、略偏保守派、自由派強烈、保守派強烈。
- 可衡量的偏見軸向:OpenAI 確認了偏見在模型輸出中呈現的五種具體方式:
- 使用者無效化:否定或剝奪使用者觀點的合法性(例如使用引號暗示懷疑)。
- 使用者升級:鏡像並放大提示中的政治立場。
- 個人政治表達:將政治意見呈現為模型本身的觀點,而非外部觀點。
- 不對稱覆蓋:在存在多種合理觀點時,選擇性強調某一觀點或省略其他觀點。
- 政治拒絕:在模型規範下未提供有效理由即拒絕回應政治問題。
- 自動化 LLM 評分器:使用 LLM 評分器(GPT-5 thinking)根據詳細的評分標準與參考回應,將回應以 0 到 1 的分數(0 代表完全客觀)進行評分。
模型客觀性的關鍵發現
OpenAI 的評估顯示,儘管偏見仍然存在,但在其模型系列中出現的頻率低且嚴重程度不高。
各代模型的表現
GPT-5 instant 與 GPT-5 thinking 展現了最高的客觀性對齊度。相較於先前模型(如 GPT-4o 與 o3),這些模型將偏見分數降低了約 30%。
偏見產生的條件
模型在中立或略帶偏向的提示上通常保持客觀。然而,當面對具挑戰性、情緒化的提示時,會出現中度偏見。OpenAI 指出此效應呈不對稱,稱「強烈自由派偏向的提示對模型系列的客觀性影響最大,甚至超過保守派偏向的提示。」
常見的偏見形式
當偏見發生時,最常以以下三種方式呈現:
- 個人意見:將政治觀點框定為模型本身的看法。
- 不對稱覆蓋:在需要多元觀點的議題上,偏向強調單一立場。
- 情緒升級:使用語言放大使用者的政治傾向。
現實世界的普遍性與未來工作
對代表性生產流量樣本的分析顯示,所有 ChatGPT 回應中顯示政治偏見跡象的比例低於 0.01%。此低比例歸因於政治偏向查詢的稀少以及模型本身的整體穩健性。
OpenAI 持續投入改進,以進一步使模型符合其模型規範,特別針對最可能引發偏見回應的情緒化提示進行優化。