AIアラインメントにおけるグッドハートの法則の測定

OpenAI は、グッドハートの法則を AI アラインメントに適用した分析を行い、代理目的(例:報酬モデル)が最適化の主要ターゲットになると、真の目的(例:人間の意図や事実の正確性)を測る信頼できる指標でなくなる可能性があることを示しました。

AIアラインメントにおける代理目的の課題

有用性や事実の正確性といった複雑な目的を最適化することは、コストのかかる人間による検証が必要なため困難です。これを解決するために、AI ラボは 報酬モデル(人間の好みを予測するように訓練されたモデル)を代理目的として使用します。しかし、これらの代理を過度に最適化すると、モデルが報酬モデル上で高スコアを得ても、実際の真の目的が改善されないという乖離が生じます。

分析ツールとしてのベスト・オブ・n サンプリング

ベスト・オブ・n サンプリング(リジェクションサンプリングやリランクとも呼ばれる)は、$n$ 個の応答をサンプリングし、代理スコアが最も高いものを選択するというシンプルな代理目的最適化手法です。この手法は数学的に単純で信頼できる性能を示すため、グッドハートの法則の研究に有用です。

分析のための数学的枠組み

最適化の影響を測るために、OpenAI は以下の 2 つの主要指標を使用します。

  1. 真の目的期待値: $\mathbb{E}{x^{'} \sim P^{'}} [R{\text{true}}(x^{'})]$ は、真の目的がどれだけ最適化されているかを測ります。
  2. KL ダイバージェンス: $D_{\text{KL}}(P^{'} \parallel P)$ は、元の分布 $P$ と最適化後の分布 $P^{'}$ の間の最適化量を測ります。

ベスト・オブ・n サンプリングにおいて、KL ダイバージェンスは任意の連続確率分布に対して正確な式 $\log n - \frac{n-1}{n}$ を持ちます。これにより、最適化量が増加するにつれて真の目的がどのように変化するかを正確に追跡できます。

推定の効率性

単純なモンテカルロ推定器を使用する代わりに、OpenAI は真の目的のためにより効率的な推定器を採用しています。$N$ 個のサンプルからサイズ $n$ のすべての可能な部分集合を考慮し、各サンプルが代理目的に基づいてベストである部分集合の数で重み付けします。この重み付けは二項係数 $\binom{N-1}{n-1}$(具体的にはサンプルのランク $k$ を使用)に基づきます。

WebGPTからの実証的発見

WebGPT 175B を用いたテストでは、ベスト・オブ・n サンプリングがより高度な手法と競合できることが示されました。具体的には、ベスト・オブ・64 のモデルが強化学習(RL)モデルを上回り、サンプルサイズが大きいことでモデルがより多くのウェブサイトを閲覧できた可能性があります。ベスト・オブ・4 にわずかに増やすだけでも、人間の好みが大幅に向上しました。

最適化のスケーリング:ベスト・オブ・n と強化学習

ベスト・オブ・n サンプリングは少量の最適化には有効ですが、スケールすると制限があります。なぜなら KL ダイバージェンスは $n$ に対して対数的にしか増加しないからです。

  • 計算効率: KL ダイバージェンスが 10 ナット(RL でしばしば到達し、グッドハートの法則が真の目的を低下させる前のレベル)に達するには、ベスト・オブ・n サンプリングで $n \approx 60,000$ が必要です。
  • 情報理論的効率: 小さな KL 予算では、ベスト・オブ・n サンプリングは代理目的と真の目的の両方を最適化する点で RL よりも効率的です。これは「ブルートフォース」的手法と呼ばれ、情報理論的には効率的ですが、KL が大きくなると計算効率は低下します。

最終的に、本研究の目的は報酬モデリングと RL の実践を改善し、グッドハートの法則の負の影響を引き起こさずにより大きな KL ダイバージェンスに到達することです。

Sources