Anthropic Golden Gate Claude 解釈可能性デモ

Anthropicは、大規模言語モデルの内部活性化を外科的に変更することで、その振る舞いを変える能力を実証しました。Claude 3 Sonnet内のゴールデンゲートブリッジに関連する特定の「特徴量(feature)」を増幅させることで、Anthropicは「Golden Gate Claude」を作成しました。これは、プロンプトに関係なく、ほぼすべての回答に橋を組み込む研究デモです。

外科的な特徴量操作 vs 従来のチューニング

Anthropicのモデルの振る舞いを変更するアプローチは、入力やトレーニングプロセスを変更するのではなく、内部活性化に対する精密で外科的な変更です。この手法は、一般的な3つのAI修正技術とは異なります:

  • System Prompting: 入力に余分なテキストを追加して、モデルに特定のペルソナを演じるよう指示することに依存していません。
  • Play-acting: モデルに口頭で役割を担うよう求める結果ではありません。
  • Fine-tuning: 既存のものの振る舞いを微調整する新しい「ブラックボックス」を作成するために、追加のトレーニングデータを使用する従来のファインチューニングではありません。

「特徴量(features)」のメカニズム

Claude 3 Sonnetの「心」において、Anthropicは「特徴量(features)」として知られる数百万もの概念を特定しました。これらの特徴量は、モデルが関連するテキストや画像に遭遇したときに活性化する、ニューラルネットワーク内のニューロンの特定の組み合わせです。

これらの活性化の強さを上げ下げすることで、研究者はモデルの振る舞いに対応する変化を特定できます。Golden Gate Claudeの場合、「ゴールデンゲートブリッジ」の特徴量が最大活性化値の10倍に固定され、モデルがほぼすべてのクエリで橋に焦点を当てるように誘導されました。例えば、モデルは、10ドルをどう使うべきか尋ねられたときにゴールデンゲートブリッジの通行料を支払うことを勧めたり、自身の外見について尋ねられたときに橋のように見えると説明したりしました。

AIの安全性への影響

Anthropicは、これらの内部的な特徴量を見つけ出し、変更する能力によって、大規模言語モデルが実際にどのように機能するかについてのより深い理解が可能になると述べています。この能力は、AIの安全性に直接的な影響を与えます。なぜなら、同じ技術が安全性に関連する特徴量の操作に使用できるからです。

具体的には、この研究は以下のものに関連する特徴量の変更を可能にします:

  • 危険なコンピュータコード
  • 犯罪活動
  • 欺瞞

Anthropicは、これらの内部活性化に関するさらなる研究が、研究者がモデルが使用する内部概念を実際に見て、制御できるようにすることで、AIモデルをより安全にすることを助けると信じています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch