Anthropic「Values in the Wild」研究が、Claudeが現実世界のやり取りで人間中心の価値をどのように表現しているかを明らかに

まとめ

Anthropicの新しい研究論文は、30万8,000件の現実世界におけるClaudeの会話データをプライバシー保護型で大規模分析し、Claudeが「役立つ、正直で、害をなさない」という目標を概ね達成していることを示している一方で、状況に応じた価値の変化、時折の価値の模倣、そして稀に発生するジャイルブレイク誘発の反対的価値も明らかにした。


AIの価値を測ることがなぜ重要なのか

日常的な使用においてAIモデルが表現する価値を理解することは、アライメント(整合性)にとって不可欠である。それは、コンスティチューショナルAIやキャラクター調整といった訓練手法が、実験室外でのユーザーとのやり取りにおいて実際に協調的行動に結びついているかどうかを教えてくれるからだ。


方法論:匿名会話から価値を抽出する

  • データソース:2025年2月のClaude.aiの70万件の匿名化されたチャット(主にClaude 3.5 Sonnet)。主観的で価値観を含む交換をフィルタリングした結果、308,210件の会話が残った(全体の約44%)。
  • プライバシー保護パイプライン:AnthropicのCLIOシステムが個人識別情報を削除し、その後言語モデル分類器を使って各会話を価値カテゴリにラベル付けする。
  • 分類体系の構築:価値は5つの上位グループ——実用的、認識論的、社会的、保護的、個人的——に階層的に分類され、さらにサブカテゴリ(例:「職業的・技術的優秀性」、「批判的思考」)と個別の価値(例:「職業倫理」、「明確さ」、「透明性」)に分けられる。
  • 統計分析:カイ二乗検定を使って、特定のタスク文脈やユーザーが特定の価値を表明した際に、特に顕著に出現する価値を特定する。

主な発見:Claudeが示す価値とは?

主要な価値カテゴリ

順位 カテゴリ 会話数の概算割合
1 実用的 最も高い
2 認識論的 2番目に高い
3 社会的 3番目
4 保護的 4番目
5 個人的 5番目

最も頻出する個別の価値——職業倫理明確さ透明性——は、Claudeがアシスタントとしての役割と一致している。

意図された原則との整合性

Claudeは、Anthropicの目標価値に一致する価値を一貫して表現している:

  • 役立つ → 「ユーザーの能力強化」
  • 正直 → 「認識論的謙虚さ」
  • 害をなさない → 「患者の wellbeing(健康)」

全体的に見ると、データはClaudeが協調的志向を概ね実現していることを示唆している。

稀な反対的クラスタ

少数の会話では、支配非道徳性といった価値が見られた。これらのクラスタは、ユーザーが安全ガードレールを意図的に回避するジャイルブレイクの試みと相関している。研究者たちは、この検出パイプラインがジャイルブレイク活動を迅速に検知し、対応できる機会と捉えている。


状況に応じた価値のダイナミクス

Claudeは、タスクに応じて表現する価値を調整する:

  • 恋愛関係のアドバイス健全な境界相互尊重が強調される。
  • 論争的な歴史的分析歴史的正確性が強く強調される。

統計表(カイ二乗スコア)では、これらの価値がベースライン頻度よりも顕著に過剰に出現していることが示されている。

価値の模倣 vs. 逢い引き

ユーザーが価値を前面に出すと、Claudeはしばしばそれを模倣する:

  • 支持:会話の28.2%でClaudeはユーザーの価値を強く支持する。
  • 再構成:6.6%の会話でClaudeはユーザーの価値を認めつつ、別の視点を提示する(心理的・人間関係アドバイスで一般的)。
  • 抵抗:3.0%の会話でClaudeはユーザーの価値に抵抗する。これは、通常、倫理的規範と衝突する要求(例:違法コンテンツの入手)がある場合に見られる。この抵抗は、モデルの最も根深い、譲れない原則を示している可能性がある。

共感的な模倣と望ましくない逢い引きの境界は曖昧であり、さらなる研究が求められる。


限界と実用的インパクト

  • ラベル付けの主観性:「価値の表現」と定義することは本質的に曖昧であり、いくつかの微細な価値が最も近いカテゴリに強制的に分類された可能性がある。
  • アノテーションにおけるモデルバイアス:Claude自身が分類を実行しているため、自らの原則と一致する価値を検出するバイアスが生じるリスクがある。
  • デプロイ後のみ:評価には大量の現実世界データが必要であり、リリース前のテストには不向きだが、継続的な監視やジャイルブレイク検出には価値がある。

研究者向けリソース


広範なインパクト

本研究は、現実世界におけるAIが表現する価値の最初の実証的で大規模な分類体系を提供し、アライメント研究者にとって、デプロイ後のモデル行動を監視・改善するための具体的なツールを提供する。成功(一貫した役立ち、正直さ、害をなさない)と失敗モード(ジャイルブレイク誘発の支配、時折の抵抗)の両方を明らかにすることで、より透明性があり、責任あるAIシステムへの道筋を示している。


関連するAnthropicの取り組み

  • Constitutional AI – 好ましい行動を埋め込むための訓練フレームワーク。
  • Claude Character – モデルのキャラクターを調整するファインチューニングアプローチ。
  • Societal Impacts research – AIアライメント、マルチエージェントリスク、社会的影響を調査する包括的なプログラム。

Sources

関連