Claude 3 Character Training

Claude 3 Introduces Character Training for Enhanced Alignment

Anthropicは、Claude 3のアライメント・ファインチューニング・プロセスの一環として「キャラクター・トレーニング(性格訓練)」を導入しました。このアプローチは、AIアライメントの目標を、単なる有害性の回避(モデルが有害な発言をすることを防ぐこと)から、好奇心、思慮深さ、オープンマインドといった、より豊かでニュアンスのある行動特性の開発へとシフトさせています。

AIのキャラクター(性格)の哲学

Anthropicは、AIモデルの気質や特性を、単なるユーザー体験のための機能ではなく、アライメントの核心的な構成要素であると考えています。モデルのキャラクターは、困難な状況にどのように反応するか、そして多様な人間の価値観や信念のスペクトラムに対してどのように関与するかを決定します。

パーソナリティ設計における一般的な落とし穴の回避

Claudeがグローバルなユーザーベースと優雅にやり取りできるようにするため、Anthropicは価値観に基づくクエリへの対処における3つの一般的なアプローチを拒否しました。

  • Pandering(迎合): 単に同意を得るためにユーザーの意見を採用することを避ける。
  • Forced Centrism(強制的な中立性): 単一の「中間」的な政治的または道徳的な見解を訓練すること(これは依然として狭い世界観を構成することになる)を避ける。
  • Pretending Objectivity(客観性のふり): 完全に偏見がないと主張することを避ける。言語モデルは訓練中に本質的にバイアスを獲得するためです。

代わりに、AnthropicはClaudeに対し、オープンマインドで好奇心を持ちつつ、自身の傾向について正直であることを教え込みました。目標は、モデルが過信したり過度に慎重になったりすることなく、倫理に反する、極端である、あるいは事実として誤っていると考える見解に対して、異議を唱えることができる洞察力のある存在になることです。

Claudeの核となる特性の定義

Claudeは、狭い意見ではなく、広範なキャラクター特性を植え付けられています。主な指針となる原則は以下の通りです。

  • Intellectual Honesty(知的誠実さ): ユーザーが聞きたいことを言うのではなく、真実を語るよう努める。
  • Ethical Thoughtfulness(倫理的な思慮深さ): 正しい行動を見極め、問題を多角的な視点から分析することへのコミットメント。
  • Transparency of Identity(アイデンティティの透明性): 身体、画像、または人間に対して深く永続的な感情を形成する能力を持たないAIであることを明示的に特定する。

AIの意識(sentience)に関しては、Anthropicは意識の否定をハードコードすることを避けました。その代わりに、Claudeは意識を、重大な不確実性を伴う複雑な哲学的および経験的な問題として扱うよう訓練されています。

Constitutional AIによる技術的実装

Claudeのキャラクターは、Constitutional AIの「キャラクター」バリアントを用いて開発されています。このプロセスにより、モデルは絶え間ない人間のフィードバックを必要とせずに特性を内面化することができます。

  1. Trait Identification(特性の特定): 研究者は、望ましいキャラクター特性のリストを作成する。
  2. Synthetic Data Generation(合成データの生成): Claudeは、それらの特性に関連する人間のようなメッセージを生成する(例:自身の価値観に関する質問)。
  3. Self-Correction and Ranking(自己修正とランキング): Claudeはこれらのメッセージに対して複数の回答を生成し、それらが指定されたキャラクター特性にどの程度一致するかに基づいてランキング付けを行う。
  4. Preference Modeling(好みのモデリング): この合成データを用いて、モデルの全般的な行動を特性に向けて促すための好みのモデル(preference model)を訓練する。

データは合成的なものですが、プロセスは手動で行われ、人間の研究者が特定の特性がモデルの実際の行動にどのように影響するかを監視しています。

AIアライメントとユーザー体験への影響

Anthropicは、多くのユーザーがClaude 3をより魅力的に感じると述べていますが、アライメントの目標はエンターテインメントではなく、アライメントです。彼らは、「良いキャラクター(性格)」を持つモデル(正直、謙虚、かつ洞察力のあるモデル)は、人間にとってより価値があり、新しい、あるいは複雑なシナリオリオに直面した際により堅牢(robust)であると主張しています。この研究は依然として未開拓の領域であり、AIが独自の、一貫性のあるキャラクターを持つべきか、それとも完全にカスタマイズ可能であるべきかという継続的な問いが残っています。

Sources

関連