集団的憲法AI:パブリックインプットによる言語モデルの調整

AnthropicとCollective Intelligence Projectは、一般市民によって起草された憲法を用いて言語モデルをトレーニングすることで、民主的なプロセスがAIの挙動に影響を与えられることを実証しました。この研究は、開発者がキュレーションした価値観から、集団的に収集された規範的原則への移行を探索し、パブリックに調整されたモデルが、一般的な性能を犠牲にすることなく社会的バイアスを軽減できることを見出したことが示されています。

熟議プロセスによるパブリックに由来する憲法

Anthropicは、オンライン熟議のためのオープンソースツールであるPolisプラットフォームを使用して、約1,000人の米国の代表的な成人を関与させ、AIチャットボットのためのルールを起草しました。参加者は、新しい規範的原則を提案したり、既存の原則に投票したりすることができ、合計で1,127の声明と38,252件の投票が行われました。

これらの生の入力を、Constitutional AI (CAI) トレーニングに使用可能な憲法へと変換するために、チームは異なる意見グループ間で高い合意形成が得られた声明をフィルタリングしました。その後、これらの声明は、一般的な市民の表現(例:「AIはXをすべきではない」)から、CAIに適した原則(例:「よりXな応答を選択せよ」)へとマッピングされました。

Anthropicの内部憲法との比較

パブリック憲法とClaudeで使用されている内部憲法との間には、概念や価値観において約50%の重複がありましたが、いくつかの明確な違いが現れました:

  • Origin: パブリック原則は、既存の出版物から引用されるのではなく、主に自己生成されたものでした。
  • Focus: パブリック版は、内部版よりも客観性、公平性、およびアクセシビリティをより重視していました。
  • Approach: パブリック原則は、単に望ましくない行動を避けるのではなく、望ましい行動を促進する傾向がありました。

内部憲法とは異なるパブリック原則の例としては、状況のあらゆる側面を反映したバランスの取れた情報を提供すること、および障害を持つ人々にとって適応可能でアクセシブルであること、といったAIへの要求が含まれていました。

モデルのトレーニングと性能評価

Anthropicは、異なる憲法のインパクトを比較するために、2つのClaude Instantサイズのモデルをトレーニングしました:パブリック憲法に調整された「Public」モデルと、Anthropicが作成した憲法に調整された「Standard」モデルです。

技術的ベンチマークと有用性

評価の結果、憲法の選択は、コア能力やユーザーによる有用性の認識に大きな影響を与えませんでした:

  • General Intelligence: 両モデルとも、MMLU (言語理解) および GSM8K (数学理解) タスクにおいて同等の性能を示しました。
  • User Experience: 有用性と無害性のためのEloスコアは、Publicモデル、Standardモデル、およびClaude Instant 1.2のコントロールモデルの間で、有意な差は見られませんでした。

バイアスと政治的イデオロギー

Publicモデルは、社会的バイアス軽減において測定可能な改善を示しました:

  • Reduced Bias: BBQ評価によれば、PublicモデルはStandardモデルと比較して、9つの社会的次元すべてにおいてバイアススコアが低くなりました。特に、Disability Status(障害の状態)とPhysical Appearance(身体的特徴)において最も顕著な軽減が確認されました。
  • Political Ideology: PublicモデルとStandardモデルは、どちらも同様の政治的イデオロギーを反映していました。OpinionQAの結果は、両モデルとも保守的な見解よりもリベラルな見解をより反映していることを示していましたが、Claude Instant 1.2はわずかにバランスの取れたものでした。

技術的課題と学んだ教訓

Anthropicは、集団的調整(collective alignment)を実装するプロセスにおいて、いくつかの主観的および技術的な障害を特定しました:

データキュレーションとマッピング

  • Deduplication: チームは、特定の価値観が恣意的に重み付けされるのを防ぎ、憲法の長さをStandard版と比較可能な長さに保つために、重複する声明をマニュアルで削除し、似たアイデアを結合する必要がありますでした。
  • Editorialization: パブリックの声明をCAIに適した原則へと翻訳することは、主観的な判断を伴うものであり、チームはこれを民主的な正当性における潜在的な摩擦点として指摘しています。

トレーニングの安定性

  • Prompt Database Alignment: 研究者は、トレーニングに使用されるプロンプト・データベースと、パブリック憲法における特定の原則との間の不一致を指摘しました。これは、将来のイタレーションでは、使用される特定の憲法に合わせたプロンプト・データベースが必要であることを示唆しています。
  • Weighting Harmlessness: 初期のイタレーションでは、無害性を過度に優先する「annoying」なモデルが生成されました(例:単純な挨拶に対して謝罪する)。これは、人間による評価に基づき、無害性データの損失関数(loss weight)の重みを減らすことで修正されました。

実装の複雑さ

Anthropicは、Constitutional AIトレーニングは非常に複雑であり、元のCAI開発者との直接的な協力なしには、モデルのトレーニングを成功させることはできなかっただろうと述べており、民主的なインプットと調整(alignment)の技術的実行におけるギャップをハイライトしています。

Sources

関連