Constitutional AI: Harmlessness from AI Feedback

Anthropicは、有害な出力に対する広範な人間のラベル付けに頼ることなく、AIアシスタントを無害にするためのフレームワークであるConstitutional AIを開発しました。定義済みのルールまたは原則のセット、すなわち「憲法(constitution)」を使用することで、システムは教師あり学習とAIフィードバックからの強化学習(RLAIF)という2段階のプロセスを通じて、自身の行動を改善します。

The Constitutional AI Process

Constitutional AIは、人間主導の報酬モデリングを、原則のセットに基づくAI主導の評価に置き換えます。トレーニングプロセスは、主に2つのフェーズに分かれています。

Supervised Learning (SL) Phase

教師ありフェーズでは、モデルはプロンプトに対して初期の応答を生成します。次に、以下のワークフローに基づいて、それらの応答に対する自己批判と修正を行います。

  1. Sampling: 初期モデルが応答をサンプリングします。
  2. Critique: モデルは憲法に基づいて自身の応答に対する批判を生成します。
  3. Revision: モデルは原則により適合するように応答を修正します。
  4. Finetuning: 元のモデルは、これらのAIによって生成された修正後の応答でファインチューニングされます。

Reinforcement Learning (RL) Phase

教師ありフェーズに続いて、モデルはAIフィードバックからの強化学習(RLAIF)を行います。このRLフェーズでは、システムはモデルを使用して、サンプリングされた2つの応答のうち、憲法に従ってどちらがより優れているかを評価します。これにより、AIの好みのデータセットが作成され、それが好みのモデル(preference model)を訓練するために使用されます。この好みのモデルは、最終的なRLトレーニングステップの報酬信号として機能します。

Key Capabilities and Outcomes

Constitutional AIは、無害でありながら回避的でないAIアシスタントの作成を可能にします。有害なクエリに対して単に回答を拒否するだけのモデルとは異なり、Constitutional AIアシスタントは、自身の異議を説明することで有害なクエリに対処し、意思決定プロセスに透明性を提供します。

パフォーマンスと透明性を向上させるために、教師あり学習とRLの両方のフェーズで、chain-of-thoughtスタイルの推論を活用しています。これにより、モデルは批判や修正の背後にある推論を明確に述べることができ、AIの意思決定プロセスを人間にとってより解釈可能なものにします。

Implications for AI Safety and Control

Constitutional AIは、AIの行動を大幅に少ない人間のラベル付けで、より精密に制御できることを示しています。監視の対象を個々の出力のラベル付けから、高レベルのルール(憲法)の定義へとシフトさせることで、研究者はAIシステムがより有能になるにつれて、AI自身の能力を利用して他のAIを監視するという方法で、AIシステムの安全性トレーニングをスケールアップさせることができます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch