測量 AI 對齊中的古德哈特定律

OpenAI 分析了古德哈特定律在 AI 對齊中的應用,證明當代理目標(例如獎勵模型)成為優化的主要目標時,它可能不再是衡量真實目標(例如人類意圖或事實準確性)的可靠指標。

代理目標在 AI 對齊中的挑戰

優化諸如有用性或事實準確性等複雜目標十分困難,因為它們需要昂貴的人類驗證。為了解決這個問題,AI 實驗室使用 獎勵模型——經過訓練以預測人類偏好的模型——作為代理目標。然而,過度優化這些代理可能導致模型在獎勵模型上獲得高分卻未真正提升真實目標的情況,產生分歧。

Best-of-n 抽樣作為分析工具

Best-of-n 抽樣(亦稱為拒絕抽樣或重新排序)是一種簡單的優化代理目標的方法,透過抽樣 $n$ 個回應並選擇代理分數最高的那一個。此方法對於研究古德哈特定律很有用,因為它在數學上直觀且能提供可靠的效能。

分析的數學框架

為了衡量優化的影響,OpenAI 使用兩個主要指標:

  1. 真實目標期望:$\mathbb{E}{x^{'} \sim P^{'}} [R{\text{true}}(x^{'})]$ 衡量真實目標的優化程度。
  2. KL 散度:$D_{\text{KL}}(P^{'} \parallel P)$ 衡量所施加的優化量,其中 $P$ 為原始分布,$P^{'}$ 為優化後的分布。

對於 best-of-n 抽樣,KL 散度對任何連續機率分布都有精確公式:$\log n - \frac{n-1}{n}$。這使研究人員能精確追蹤隨著優化量增加,真實目標的變化情形。

估計的效率

OpenAI 並未使用簡單的 Monte Carlo 估計器,而是採用更有效率的真實目標估計器。透過考慮從 $N$ 個樣本的較大池中抽取大小為 $n$ 的每一可能子集,他們根據樣本在代理目標下成為最佳的子集數量對其加權。此加權基於二項式係數 $\binom{N-1}{n-1}$(具體使用樣本的排名 $k$)。

來自 WebGPT 的實證發現

在對 WebGPT 175B 的測試中,best-of-n 抽樣證明與更先進的技術具有競爭力。具體而言,best-of-64 模型的表現優於強化學習(RL)模型,可能是因為較大的樣本數讓模型能瀏覽更多網站。即使僅將樣本數提升至 best-of-4,也能顯著提升人類偏好。

優化規模化:Best-of-n 與強化學習的比較

雖然 best-of-n 抽樣在少量優化時有效,但在大規模時受到限制,因為 KL 散度僅隨 $n$ 以對數方式增長。

  • 計算效率:要達到 KL 散度 10 nats——這是通常在 RL 中於古德哈特定律使真實目標下降前達到的水平——best-of-n 抽樣需要 $n$ 約為 60,000。
  • 資訊理論效率:對於小的 KL 預算,best-of-n 抽樣在同時優化代理與真實目標方面比 RL 更有效率。它被描述為一種「暴力」方法,在資訊理論上更有效率,但在大 KL 規模下計算效率較低。

最終,此研究的目標是改進獎勵模型與 RL 實踐,以在不觸發古德哈特定律負面效應的情況下達到更大的 KL 散度。

Sources