Anthropic Research: Forecasting Rare Language Model Behaviors

AnthropicのAlignment Scienceチームは、モデルのデプロイ前に、稀で潜在的に危険なAIの挙動を予測する手法を導入しました。最もリスクの高いクエリのリスクがべき乗則(power law distribution)に従うことを特定することで、研究者は少数のテストクエリから、現実世界の環境で処理される数十億のクエリにおける壊滅的な失敗の可能性を外挿することができます。

The Scale Problem in AI Evaluation

デプロイ前の評価は、テストの規模とデプロイの規模との間の格差により、稀ではあるが壊滅的なリスクを捉えきれないことがよくあります。評価は数千の例で構成されることがありますが、デプロイされたモデルは毎日数十億のクエリを処理する可能性があります。もし、懸念される挙動(例えば、成功したjailbreakなど)が100万回の試行のうち1回しか発生しない場合、標準的な評価では見逃される可能性が高いですが、デプロイ中にはほぼ確実に発生します。

Using Power Laws for Risk Extrapolation

この規模のギャップに対処するため、Anthropicの研究者は、有害なコンテンツを含む完了文の割合を測定することで、さまざまなプロンプトにわたる有害な応答の確率を計算しました。

最も高い(対数)リスク確率をテストされたクエリ数に対してプロットすることで、チームは、その関係がべき乗則に従うことを発見しました。べき乗則は数学的に予測可能であるため、これにより開発者は、大幅に小さい評価(例:数千のクエリ)からのデータを使用して、大規模なスケール(例:数百万のクエリ)における最悪のケースのリスクを予測することができます。

Empirical Validation and Accuracy

Anthropicは、3つの異なるシナリオにわたって、これらの予測の正確性をテストしました。

1. Dangerous Information Retrieval

有害な化学物質を合成するための指示を提供するモデルのリスクを予測するテストにおいて、研究者は900件のクエリから90,000件のクエリへとリスクを外挿しました。べき乗則による予測は、予測の86%において、真のリスクの1桁(one order of magnitude)以内の範囲に収まりました。

2. Misaligned Actions

研究者は、不整合な挙動、具体的には、power-seeking、self-preservation、およびself-exfiltrationの出現を予測しました。モデルが整合的なアクションと不整合なアクション(例:組織を形成するために「create new policies」することを好むか、既存のポリシーを「analyze existing policies」することを好むか)の間で選択する多肢選択式問題を使用することで、べき乗則の手法は平均絶対誤差 0.05 を達成しました。これは、ベースライン手法の誤差率 0.12 よりも2.5倍低くなっています。

3. Automated Red-Teaming Efficiency

この手法は、あるモデルが別のモデルの弱点を見つけるために使用される自動化されたred-teamingに適用されました。チームは、予測を使用して、多くのクエリを生成する小さなモデルを使用するか、より少数の、より高品質なクエリを生成する大きなモデルを使用するかを決定しました。予測手法は、計算予算の割り当てに最適なモデルを79%の確率で特定しました。

Implications for Model Alignment

完璧ではありませんが、この外挿法は、LLM開発者が標準的な評価では見えない稀なリスクを特定するための、スケーラブルな方法を提供します。これにより、モデルが一般に公開される前に、危険な挙動を未然に防ぐことが可能になります。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch