蒸留攻撃の検知と防止に関するAnthropicのレポート

Anthropicは、DeepSeek、Moonshot、MiniMaxの3つのAI研究所による、Claudeの能力を不正に抽出して自社モデルを改善しようとする産業規模のキャンペーンを明らかにしました。これらの研究所は、約24,000の不正アカウントを使用して1,600万件以上のやり取りを生成しており、これは利用規約および地域のアクセス制限に違反しています。

不正な蒸留のメカニズムとリスク

蒸留(Distillation)は、能力の低いモデルをより強力なモデルの出力を用いてトレーニングする正当なトレーニング手法です。しかし、不正な蒸留は、競合他社が独立した開発に必要な時間とコストのわずかな一部で、強力な能力を獲得することを可能にします。

国家安全保障および安全上のリスク

不正に蒸留されたモデルは、フロンティアモデルに組み込まれている重要な安全策を欠いていることがよくあります。これは、生物兵器の開発や悪意のあるサイバー活動に使用されるような危険な能力が、保護なしに拡散する可能性があるため、重大な国家安全保障上のリスクを生み出します。これらの保護されていない能力は、軍事、情報、監視システムに統合され、権威主義的な政府による攻撃的なサイバー作戦、大量監視、およびディスインフォメーション(偽情報)キャンペーンを可能にする可能性があります。

輸出管理への影響

蒸留攻撃は、AIにおける競争優位性を維持するために設計された米国の輸出管理を損なうものです。Anthropicは、海外の研究所による急速な進歩は、独立したイノベーションの結果ではなく、多くの場合、アメリカのモデルから抽出された能力に依存していると指摘しています。これらの攻撃を大規模に実行するには高度なチップが必要となるため、制限されたチップへのアクセスは、直接的なモデルトレーニングと不正な蒸留の規模の両方を制限するための重要なツールであり続けています。

特定の蒸留キャンペーンの分析

Anthropicは、IPアドレスの相関関係、リクエストのメタデータ、インフラストラクチャの指標、および業界パートナーによる裏付けに基づき、3つの異なるキャンペーンを特定の研究所に帰属させました。各キャンペーンは、エージェント的推論、ツールの使用、およびコーディングを含む、Claudeの最も差別化された能力をターゲットにしています。

DeepSeek

DeepSeekは、推論能力、強化学習のためのルーブリックベースの採点、およびポリシーに敏感なクエリに対する検閲回避の代替案の作成をターゲットとして、150,000件以上のやり取りを行いました。

主な技術は以下の通りです:

  • Chain-of-Thought Generation: Claudeに内部推論をステップバイステップで説明させることで、トレーニングデータを作成する。
  • Censorship Steering: dissidents(反体制派)や権威主義に関するクエリに対する代替案をClaudeに生成させ、検閲対象となるトピックを回避するようにモデルをトレーニングする。
  • Coordinated Traffic: 同期されたトラフィック、共有された支払い方法、およびアカウント間の「ロードバランシング」を利用して、スループットを向上させ、検知を回避する。

Moonshot AI

Moonshot (Kimi models) は、エージェント的推論、ツールの使用、コーディング、データ分析、コンピュータ使用エージェントの開発、およびコンピュータビジョンに焦点を当て、340万件以上のやり取りを実行しました。Moonshotは数百の不正アカウントを使用し、後にClaudeの推論トレースを抽出および再構成しようと試みました。

MiniMax

MiniMaxは、1,300万件以上のやり取りを行い、エージェント的コーディング、ツールの使用、およびオーケストレーションをターゲットにしました。Anthropicは、このキャンペーンがまだ活動中であった際に検知し、MiniMaxが最新のシステムから能力を抽出するために、新しいClaudeモデルのリリースから24時間以内にトラフィックを切り替えたことを観察しました。

蒸留者がアクセス制御を回避する方法

Anthropicは中国や中国企業の海外子会社に対してClaudeの商用アクセスを提供していないため、攻撃者は商用プロキシサービスを利用しています。これらのサービスは「hydra cluster」アーキテクチャを採用しており、APIやサードパーティのクラウドプラットフォームにトラフィックを分担させる不正アカウントの広大なネットワークを通じて、単一障害点を排除しています。

ある事例では、単一のプロキシネットワークが20,000件以上の不正アカウントを同時に管理し、蒸留トラフィックを正当当な顧客のリクエストと混ぜることで、操作を瞞瞞(まんまん)を隠蔽しました。

検知と対応戦略

Anthropicは、蒸留攻撃を規律(きりつ)として特定し、軽減するために、いくつかの防御層を実装しています:

  • Detection Systems: chain-of-thought 抽出のパターンや、大量のアカウントボリュームにおける協調的な活動などのパターンを特定するための、分類器と行動フィンガープリントの開発。
  • Intelligence Sharing: 技術的な指標を指標として、他のAI研究所、クラウドプロバイダー、および政府当局と共有する。
  • Access Controls: 教育用アカウント、セキュリティ研究プログラム、およびスタートアップ組織は、一般的な悪用経路であるため、これらを強化する。
  • Countermeasures: 正当なユーザーに影響を与えることなく、不正な蒸留に効果的な出力を提供することを減少させるための、製品、API、およびモデルレベルの保護策の開発。

Sources

関連