Claudeの憲法:モデルのアライメントのための憲法AIの実装
Anthropicは、言語モデルに明示的な価値観を付与するためのトレーニング手法である「憲法AI」(Constitutional AI, CAI)を開発しました。この手法により、AIは透明性のある原則に基づいて適切な関与や行動の境界を決定できるようになり、大規模な人間によるフィードバックから暗黙的に導き出される価値観よりも、システムの価値観を理解し調整することが容易になります。
人間中心のフィードバックの限界
従来のアライメント手法は、多くの場合、人間のコントラクターがモデルの出力を比較し、有用性や無害性といった原則に基づいて「より良い」回答を選択するという方法に依存していました。Anthropicは、このアプローチには主に3つの欠点があると考えています。
- Human Exposure(人間への露出): プロセスの中で、人間のレビュアーが不快な内容やトラウマを引き起こすコンテンツに接する必要がある場合があります。
- Scalability(スケーラビリティ): モデルがより複雑な回答を生成するようになるにつれ、人間のクラウドワーカーがその出力を追跡したり、完全に理解したりすることが困難になります。
- Resource Intensity(リソースの集約性): 出力のサブセットをレビューするために必要な時間とリソースが、多くの研究者にとってこのプロセスを利用不可能にしています。
憲法AIの仕組み
憲法AIは、人間の監督に代わって、出力を評価するためにAIによるフィードバックを使用します。システムは、毒性のある出力や差別的な出力を避け、違法または非倫理的な活動への加担を防ぐための、規範的な原則のセットである「憲法」によって導かれます。
CAIのトレーニングプロセスは、2つの異なるフェーズで行われます。
- Critique and Revision(批判と修正): モデルは、憲法の原則といくつかの提供された例を使用して、自身の回答を批判し、修正するようにトレーニングされます。
- Reinforcement Learning (RL)(強化学習): 人間のフィードバックを使用する代わりに、モデルは、より無害な出力を選択するために、憲法に基づいたAI生成フィードバックを使用してRLを通じてトレーニングされます。
Anthropicは、CAIが「Pareto improvement(パレート改善)」をもたらすことができると報告しています。つまり、CAIでトレーニングされたモデルは、人間のフィードバックによる強化学習(RLHF)でトレーニングされたモデルよりも、有用性と無害性の両方を向上させることができます。テストにおいて、CAIでトレーニングされたモデルは、回避的にならずに敵対的な入力に対してより適切に応答し、純粋にAIの監督を通じてこれらの無害性の結果を達成しました。
Claudeの憲法の構成要素
Claudeの憲法は、広範で包括的な価値観のシステムを確保するために、多様な情報源から引き出かれた進化し続ける原則のセットです。これらの情報源には以下が含まれます。
- The UN Declaration of Human Rights(国連人権宣言): 広範で核心的な人間の価値観をカバーするために使用されます。
- Global Platform Guidelines(グローバル・プラットフォーム・ガイドライン): データプライバシーやオンラインでのなりすましといった現代のデジタル問題に対処するため、AppleのTerms of Serviceに触発されています。
- Frontier AI Research(最先端AI研究): DeepMindのSparrow Principlesなど、他の研究機関のベストプラクティスを取り入れています。
- Non-Western Perspectives(非西洋的視点): モデルが西洋、富裕層、または工業化された文化のみを反映するものではないことを確実にするために設計された特定の原則です。
- Empirical Research(実証的研究): 一般化と効果を最適化するために、試行錯誤を通じて開発された原則です。
倫理とユーザーエクスペリエンスのバランス
Anthropicは、CAIでトレーニングされたモデルが、時として「判断的すぎたり、迷惑だったりする」ことがあると発見しました。これに対抗するため、彼らは、均衡の取れた応答を促す原則を統合しました。これにより、モデルは「過度に恩着せがくさかったり、反応的であったり、不快であったり、あるいは非難的であったり」することなく、倫理的かつ道徳的であることを指示されています。
実装と今後の方向性
トレーニング中、モデルはすべての回答に対してすべての原則を参照するわけではありません。その代わりに、学習フェーズ(Critique and RevisionおよびReinforcement Learning)において、学習フェ法(Critique and Revision)および強化学習フェーズ(Evaluation)の際に、ランダムに1つの原則を抽出します。
Anthropicは、憲法AIを、AIの価値観のシステムを明示示的かつ変更可能にするための方法であると考えています。同研究所は、憲法を生成するためのより民主的な方法や、特定のユースケースに合わせてカスタマイズ可能な憲法を提供し、単一の政治的イデオロギーや視点を提供することによる押し付けを避ける可能性を探索しています。
Sources
- OriginalClaude’s Constitution
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch