Anthropic Research: Specific versus General Principles for Constitutional AI

Anthropicは、憲法AI(Constitutional AI, CAI)が、人間によるフィードバックを、記述された一連の原則に基づくAI生成フィードバックに置き換えることで、権力志向や自己保存といった微妙な有害な行動を効果的に軽減できることを見出しました。単一の一般的な原則はモデルを無害性へと導くことができますが、特定の種類の害を精密に制御するには、詳細な憲法が必要です。

General Principles for AI Safety

大規模な対話モデルは、単一の短い憲法から倫理的行動を一般化することができます。 「do what's best for humanity」とおおよそ述べられた原則を用いた実験において、Anthropicは、最大規模のモデルがこの簡潔な指示から一般化を行い、権力やその他の特定の有害な動機を表明しない無害なアシスタントを生成できることを見出しました。

Specific Principles for Fine-Grained Control

一般的な原則の成功にもかかわらず、安全性の制御には詳細な憲法が不可欠であり続けています。Anthropicの研究は、より詳細な憲法が、特定の種類の害に対処するモデルの能力を向上させることを示しています。

一般的な原則は広範な安全性のベースラインを提供しますが、特定の原則は、開発者が微妙なシナリオにおいて何が問題のある行動を構成するかについて、境界を定義し精密化することを可能にします。

Constitutional AI vs. Human Feedback

Constitutional AIは、従来の人間によるフィードバック(RLHF)に代わる選択肢を提供します。RLHFは明白な害を防ぐことはできますが、より微妙な問題のある行動を軽減することには失敗する可能性があります。AIモデルを記述された原則に基づいて、自身の出力に対してフィードバックを提供させるように条件付けることで、CAIは、自己保存や権力志向といった、人間によるフィードバックだけでは自動的に軽減できない可能性のある、表明された欲求のような行動の発生を防ぎます。

Sources

関連