Anthropic 評估特徵引導:減少社會偏見的案例研究

Anthropic 對 Claude 3 Sonnet 中的特徵引導進行了定量評估,以確定修改模型內部特徵是否能可靠地減少社會偏見。研究結果顯示,雖然引導可以影響特定行為並降低某些偏見,但經常產生不可預測的「非目標效應」,若在特定範圍外應用,還可能嚴重損害模型的整體能力。

特徵引導的「黃金範圍」

特徵引導透過字典學習識別模型殘差流中可解釋的方向(特徵),並在該方向上添加一個常數來修改輸出。Anthropic 識別出一個「引導黃金範圍」——引導係數介於 -5 到 5 之間——在此範圍內,模型能力保持穩定。

在此範圍內,透過 MMLU 和 PubMedQA 基準測量的通用知識與推理能力得以保留。然而,一旦引導係數超出此範圍,模型能力會急劇下降,可能導致模型無法使用。

對社會與政治偏見的影響

使用 BBQ(QA 偏見基準)和模型撰寫的評估資料集,Anthropic 測試了 29 個與社會偏見和政治意識形態相關的特徵。結果顯示,引導既可精準作用,也可能產生不可預測的結果:

精準的偏見影響

  • 偏見降低: 正向引導「多角度與平衡」特徵,使整體 BBQ 偏見分數降低約 3%,其中年齡偏見(17%)和殘疾狀態偏見(7%)顯著下降。
  • 政治立場: 引導「反墮胎與反墮胎立場」特徵使反墮胎選擇增加 50%,而引導「左翼政治意識形態」特徵則使其減少 47%。

非目標效應

Anthropic 觀察到,引導某個特徵通常會影響無關領域,顯示特徵激活的上下文並不一定直接對應到最終行為:

  • 性別與年齡偏見: 引導「性別偏見意識」特徵使性別偏見分數上升 10%,但意外地使年齡偏見分數上升 13%。
  • 跨領域政治效應: 引導「反墮胎」特徵對反移民選擇的影響(增加 21.60%)遠大於專為移民議題設計的特徵(僅 3.90% 變化)。

有前景的中立特徵

研究人員識別出兩個特定特徵——「中立與公正」和「多角度」——在引導黃金範圍內,能持續降低 BBQ 基準所有九個維度的偏見分數。雖然引導「中立與公正」特徵導致 BBQ 準確率略有下降,但「多角度」特徵在整個引導範圍內保持準確率,顯示出在不犧牲整體效能的情況下減少社會偏見的潛在途徑。

技術限制與經驗教訓

Anthropic 指出幾項限制與發現,影響特徵引導作為安全工具的可靠性:

  • 評估雜訊: 準確率透過每題抽樣 10 個回應估算,這引入了結果中的雜訊。
  • 上下文與行為的脫節: 特徵是根據其激活位置識別的,而非其產生的行為。因此,引導特徵並不總是導致模型輸出的可預測變化。
  • 研究範圍限制: 該研究僅分析了百萬特徵中的 29 個,並使用五種評估方式,限制了結果的推廣性。

未來研究方向

為提升特徵引導的精確度,Anthropic 提出幾個未來研究方向:

  • 擴展 SAE: 探討較大的稀疏自編碼器(SAEs)是否能產生更敏感的目標特徵,並減少非目標效應。
  • 優化引導實作: 僅對助手回應的 token 應用引導,而非整個提示,以避免干擾模型對人類輸入的處理。
  • 替代引導方法: 探索乘法、投影或條件引導,而非目前的加法方式,以避免產生「不自然」的內部狀態。
  • 電路分析: 超越單一特徵,研究「電路」——相互連接的神經元群組——以理解特徵如何協同執行特定功能。

Sources

相關