Anthropic 研究:評估與緩解語言模型決策中的歧視問題

Anthropic 開發了一種方法,旨在主動評估並緩解語言模型 (LMs) 在應用於高風險社會決策時可能產生的歧視風險。這項研究專注於識別模型在不同情境下回應中的偏見模式,為開發者和政策制定者提供了一個框架,以便在部署前衡量並解決這些風險。

評估歧視影響的方法論

Anthropic 的評估框架使用語言模型來生成大量決策者在實際應用中可能使用的潛在提示詞 (prompts)。研究人員系統性地改變了這些提示詞中的人口統計資訊,以測試是否會產生歧視性的結果。

  • 測試範圍: 研究人員在涵蓋各種社會背景(包括金融和住房資格)的 70 個不同決策情境中測試了模型。
  • 流程: 透過改變人口統計標記,研究人員可以隔離人口統計資訊對模型決策過程的影響。
  • 主動方法: 此方法論允許評估模型尚未部署的假設性使用案例,在風險發生前進行預判。

Claude 2.0 的研究結果

在未進行任何干預的情況下,將此方法論應用於 Claude 2.0 時,研究人員在特定設定下發現了正面與負面歧視的模式。這顯示模型可能會根據提示詞中的人口統計資訊,對某些人口統計群體表現出偏好或偏見。

緩解策略與安全指南

雖然 Anthropic 明確表示,他們並不贊成或允許將語言模型用於所研究的高風險使用案例進行自動化決策,但他們證明了透過精細的提示詞工程 (prompt engineering) 可以顯著降低歧視。

提示詞工程作為緩解工具

透過精細的提示詞工程來減少正面與負面歧視。研究人員發現,在提示詞中提供具體的指令或約束條件以確保公平性與中立性,可以帶來更安全的結果。

部署考量

研究強調,模型的評估是一項主動措施,旨在確保隨著 LM 能力的擴展,系統性偏見的可能性能得到處理。Anthropic 已透過 Hugging Face 向公眾發布了其數據集和提示詞,以促進對模型公平性的進一步研究。

對 AI 安全與政策的啟示

這項工作為開發者和政策制定者提供了一條路徑,用於預期、衡量並解決 AI 系統中的歧視問題。透過建立一種系統性的方式,在廣泛的情境中改變人口統計資訊,AI 社群可以朝著在社會應用中更公平地部署語言模型邁進。

Sources

相關