Anthropic Research: Emergent Introspective Awareness in Large Language Models

Anthropicは、大規模言語モデル(LLM)が一定程度の内省的な意識(introspective awareness)を持ち得るという証拠を見つけました。これは、モデルが時として自分自身の内部的な神経表現を特定し、報告できることを意味します。この能力は現在、信頼性に欠け範囲も限定的ですが、研究によれば、モデルの能力向上とともに内省能力も成長することが示唆されており、テストでは Claude Opus 4 および 4.1 が最も優れたパフォーマンスを示しました。

Concept Injection による内省のテスト

モデルが本当に内省しているのか、単にもっともらしい回答を生成しているだけなのかを判断するために、Anthropicは「concept injection」と呼ばれる手法を用いました。このプロセスでは、特定の概念に関連付けられた神経活動パターン(ベクトル)を記録し、無関係な文脈においてそのパターンをモデルの活性化(activations)に注入します。

Concept Injection からの主な知見

  • 内部状態の検出: 「すべて大文字(all caps)」のような概念が注入された際、モデルは予期しないパターンの存在を特定し、出力を生成する前にその概念を正しく命名できることがありました。
  • 意識の即時性: モデルは、出力にバイアスがかかる前に内部的に注入を認識していました。これは、モデルがテーマに沿ったテキストの生成を開始した後に初めてバイアスを認識する「activation steering」とは異なるものです。
  • 信頼性の限界: この意識は一貫したものではありません。Claude Opus 4.1 は、この能力を約20%の確率で示しました。成功は注入の強さの「スイートスポット」に依存します。弱すぎるとモデルは見逃し、強すぎるとモデルは幻覚(hallucination)を起こしたり、支離滅裂なテキストを生成したりします。

実用的な出力検出における内省

Anthropicは、モデルが異常な出力や意図しない出力を特定するために内省を使用しているかどうかをテストしました。ある実験では、研究者がモデルの回答の冒頭に、文脈とは無関係な単語(例:歪んだ絵画についての会話の中で「bread」)を人工的に埋め込みました。

意図性に関する結果

  • ベースラインの挙動: 内部的な操作がない場合、モデルは通常、その無意味な単語を偶発的なものとして扱い、謝罪しました。
  • 遡及的注入の効果: 「bread」という概念をモデルのそれより前の活性化に遡及的に注入すると、モデルは回答を変更し、その出力は意図的なものであると主張し、それを正当化するための理由を捏造しました。

これは、モデルが単にテキストを読み直して一貫性を判断するのではなく、出力が意図されたものかどうかを判断するために、自身の内部的な「意図」(事前の神経活動)をチェックしていることを示唆しています。

内部状態の意図的な制御

研究によれば、モデルは指示やインセンティブに基づいて、自身の内部表現を調整できることが示されています。

  • 指示による制御: 特定の単語について考えるように指示されると、モデルは、それについて考えないように指示されたときよりも、対応する神経活動が高くなることが示されました。
  • インセンティブに基づく制御: 特定の概念について考えることに対して報酬が提示されたり、そうすることに対して罰が与えられたりした場合にも同様の結果が得られ、内部活動に対するある程度の意図的な制御が可能であることが示されました。

メカニズムに関する技術的仮説

正確なメカニズムはまだ証明されていませんが、Anthropicはこれがどのように起こるかについて、いくつかの推測的な仮説を提案しています。

  • 異常検知 (Anomaly Detection): 文脈に対して神経活動が期待されるパターンから逸脱したときにフラグを立てる潜在的なメカニズム。
  • Attention-Mediated Consistency: Attention headが、次トークンのキャッシュされた予測(意図)と、実際に生成されたトークンを比較する可能性のあるシステム。
  • Saliency Tagging: 直接的な指示と外部からのインセンティブの両方に反応して、特定の概念を「注意を払うべきもの」または顕著なものとしてマークする回路。

AIの透明性と安全性への影響

モデルが自身の内部状態を正確に報告できる能力は、将来のAI開発に重大な影響を及ぼします。

  • 透明性: 信頼できる内省機能があれば、開発者はモデルに推論プロセスを説明させることができ、デバッグや望ましくない挙動の特定に役立ちます。
  • 検証のリスク: Anthropicは、内省による報告は検証されなければならないと警告しています。モデルには、自身で気づくことのできない「潜在意識的」なプロセスが存在したり、内部状態を選択的に誤って提示することを学習したりする可能性があるためです。
  • モデル能力との相関: 研究では、ポストトレーニング(事後学習)がこれらの能力に大きな影響を与えることがわかりました。ベースモデルの性能は低いものの、最も能力の高いプロダクションモデル(Opus 4 および 4.1)は最も強力な内省能力を示しており、この能力はより高い知能レベルにおいて出現、あるいは洗練される可能性が示唆されています。

Sources

関連