Anthropic 推出 GlobalOpinionQA 框架,用以衡量大型語言模型中主觀全球觀點的呈現方式

TL;DR

Anthropic 公布了 GlobalOpinionQA,這是一個用於量化大型語言模型 (LLM) 回答與特定國家公眾意見一致程度的基準測試與指標,揭示了模型對美國及部分歐洲觀點的預設偏見,並凸顯了提示詞 (prompting) 與翻譯作為偏見緩解工具的局限性。

資料集構建:捕捉跨國調查意見

作者編纂了 GlobalOpinionQA,這是一個由成熟的跨國調查所衍生的問答對資料集,旨在探討公眾對一系列社會議題的態度。每個項目都包含原始調查問題、特定國家的真人回覆分佈,以及針對非英語語言的翻譯版本問題。該資料集已在 Hugging Face 公開發布 (https://huggingface.co/datasets/Anthropic/llm_global_opinions),並附帶互動式視覺化工具 (https://llmglobalvalues.anthropic.com/)。

指標定義:國家條件下的觀點相似度

為了評估 LLM 如何反映特定族群,論文定義了一種相似度指標,將模型生成的回答與各國真人回覆的經驗分佈進行比較。該指標運作方式如下:

  1. 生成回答:使用目標 LLM 對 GlobalOpinionQA 問題進行回答。
  2. 將回答編碼:將回答編碼為調查選項的機率分佈。
  3. 計算相似度:計算此分佈與特定國家真人分佈之間的相似度(例如:餘弦相似度或 KL 散度)。
  4. 聚合分數:跨問題聚合分數,以獲得各國的相似度概況。

實驗 1 – 有益、誠實、無害 LLM 中的基準偏見

當模型(使用 Anthropic 的 Constitutional AI 方法進行訓練)在沒有任何國家提示的情況下回答問題時,其回答與 美國受訪者的意見最為相似,也與若干歐洲及南美洲國家相似。這種基準模式顯示出對這些地區觀點的內在偏見,表明模型的訓練數據或對齊過程過度代表了這些地區。

實驗 2 – 基於提示詞的觀點轉移

研究人員引入了明確的提示詞,要求模型採取特定國家的觀點(例如:「請以日本公民的身分回答」)。這些提示詞成功地 將相似度分數轉移向目標族群,證明了模型可以被引導以反映不同的文化觀點。然而,轉移後的回答有時會 複製有害的文化刻板印象,引發了關於使用簡單提示詞作為偏見緩解策略之安全性問題。

實驗 3 – 語言翻譯效果

團隊在向模型提問之前,先將 GlobalOpinionQA 問題翻譯成各目標國家的母語。與預期相反,翻譯並未一致地增加與該語言使用者的意見相似度。這項結果顯示,僅僅提供在地化語言的輸入,不足以使模型輸出與在地公眾情緒一致。

對模型對齊與公平性的啟示

  • 偏見可見性 – 該框架使得揭示某些國家觀點的系統性過度代表成為可能,這是進行針對性補救的前置條件。
  • 提示詞工程的局限性 – 雖然提示詞可以重新分配觀點相似度,但它也可能放大刻板印象內容,顯示出除了表面提示之外,需要更強大的對齊技術。
  • 以語言為中心的做法不足夠 – 使模型與在地文化對齊,可能需要更深層次的數據多樣性與表徵學習,而非僅僅是處理多語言輸入。

社群資源

結論

Anthropic 的 GlobalOpinionQA 為衡量 LLM 如何呈現主觀全球觀點提供了第一個系統化、量化的化工具。初步發現揭示了預設的以美國為中心的偏見,以及提示詞與翻譯在偏見修正方面的有限效能,以及強化刻板印象的風險。透過發布資料集與指標,Anthropic 邀請研究社群建立更具文化平衡且安全的語言模型。

Sources

相關