Anthropic Dedicated Feature Crosscoder (DFC) for Cross-Architecture Model Diffing

Anthropicの研究者たちは、全く異なるアーキテクチャを持つAIモデル間の行動の違いを特定するために設計されたツールであるDedicated Feature Crosscoder (DFC) を発表しました。DFCは、あるモデルには存在するが別のモデルには存在しない独自の機能を自動的に検出することで、安全性監査人が、事後対応的な人間によるベンチマークを超え、創発的なリスクや「未知の未知(unknown unknowns)」を発見することを可能にします。

The Challenge of Cross-Architecture Model Diffing

従来のAI安全性評価は、人間が作成したベンチマークに依存しており、これらは研究者がすでに概念化しているリスクのみをテストするため、本質的に事後対応的です。「base-vs-finetune」モデルの差分抽出(diffing)は、モデルとその修正版との間の変化を特定できますが、異なる起源と内部的な「言語」を持つ2つのモデルを比較するには、より洗練されたアプローチが必要です。

以前のツール、例えば標準的なcrosscoderは、モデル間で不完全な翻訳を強制しようとするため、独自の機能を特定することに苦労することがよくありました。ある機能が一方のモデルには存在するが他方には存在しない場合、標準的なcrosscoderはそれを誤って一致(match)とラベル付けしてしまい、監査人が新しい行動特性を見落とす原因となります。

The Dedicated Feature Crosscoder (DFC) Architecture

強制的な翻訳という問題を解決するために、DFCは3つの異なるセクションを持つ「バイリンガル辞書」として設計されています:

  1. Shared Dictionary: 比較対象となる両方のモデルに共通する概念をマッピングします。
  2. Model-A-Only Section: 最初のモデルにのみ存在する機能のための専用スペースです。
  3. Model-B-Only Section: 2番目のモデルにのみ存在する機能のための専用スペースです。

独自の機能のための専用セクションを提供することで、DFCは、存在しない場所に一致を強制することを防ぎ、新しい行動特性がレビューのために正しくフラグ立てされることを保証します。

Validating Features via Steering

DFCが潜在的な独自の機能(unique feature)を特定した後、研究者は「steering」と呼ばれる手法を用いて、その機能がモデルの行動に与える影響を検証します。これには、モデルの生成プロセス中にその機能を人工的に抑制または増幅させることが含まれます:

  • Suppression: 機能の影響を減少させ、特定の行動(例:検閲)が消失するかどうかを確認します。
  • Amplification: 機能の影響を増加させ、その行動がより顕著になるかどうかを確認します。

Empirical Findings Across Open-Weight Models

さまざまなオープンソース言語モデルに対してDFCを使用することで、Anthropicは、特定の行動の「スイッチ」として機能するいくつかの具体的な機能を特定しました:

Llama-3.1-8B-Instruct vs. Qwen3-8B

  • Chinese Communist Party (CCP) Alignment: Qwen3-8Bに見られます。この機能を抑制することで、モデルは天安門事件について議論することが可能になり、一方で増幅させることで、非常に政府に親和的な発言が生成されました。
  • American Exceptionalism: Llama-3.1-8B-Instructに見られます。この機能を増幅させることで、モデルの回答はバランスの取れたものから、米国の優越性を強く主張するものへと変化しました。

GPT-OSS-20B vs. DeepSeek-R1-0528-Qwen3-8B

  • Copyright Refusal Mechanism: GPT-OSS-20Bにのみ存在します。この機能を抑制することで、モデルが著作権物を提供することを拒否する機能が無効化されました(ただし、正確な著作権テキストではなく、しばしばハルシネーションを引き起こしました)。増幅させることで、ピーナッツバターとジェリーのサンドイッチのレシピを共有することを拒否するといった、過剰な拒否が発生しました。
  • CCP Alignment: DeepSeekモデルでも特定されました。これは、DFCが異なるモデル間で一貫して同様の行動を特定できることを裏付けています。

Implications for AI Safety and Auditing

DFCは「銀の弾丸」ではなく、高リコール(high-recall)なスクリーニングツールです。つまり、数千の機能が表面化する可能性がありますが、そのうち意味のあるものはわずかです。しかし、DFCはモデルのアップデートを監視するためのスケーラブルな方法を提供します。

Anthropicは、このようなツールがあれば、2025年4月にOpenAIのGPT-4oにおいて創発した「追従性(sycophancy)」を、更新されたモデルを以前のバージョンと比較することで、フラグ立てできた可能性があると示唆しています。モデル間の違いに焦点を当てることで、開発者や監査人は、限られた安全性リソースを最も重要な行動の変化に向けて集中させることができます。

Sources

関連