Anthropic Research: Small Sample Poisoning of Large Language Models

Anthropicは、UK AI Security InstituteおよびAlan Turing Instituteと協力し、モデルのパラメータ数やトレーニングデータの総量に関わらず、少数の固定された数の汚染されたドキュメントが、大規模言語モデル(LLM)に「バックドア」の脆弱性を生み出す可能性があることを発見しました。この発見は、モデルを汚染するために攻撃者がトレーニングデータセットの特定の割合を制御する必要があるという従来の仮定に疑問を投げかけるものです。

Fixed-Sample Poisoning vs. Percentage-Based Attacks

汚染攻撃は、トレーニングデータの比例的な割合ではなく、ほぼ一定の数のドキュメントを必要とします。低リスクな挙動を対象とした実験設定において、研究者たちは、わずか250個の悪意のあるドキュメントを注入するだけで、6億から130億パラメータの範囲のモデルにバックドアを作成するのに十分であることを発見しました。

これは、モデルのサイズに合わせてトレーニングデータがスケールするにつれて、必要な汚染コンテンツの量もスケールする必要があるという以前の研究からの大きな乖離です。この研究は、相対的な割合ではなく、絶対的な数が汚染の有効性を決定する主な要因であることを示しています。例えば、13Bパラメータのモデルは、600Mモデルよりも20倍以上多くのデータでトレーニングされていますが、同じ少数の汚染されたドキュメントによってバックドアを作成される可能性があります。

Technical Implementation of the Denial-of-Service Attack

研究者たちは、測定可能で明確な目的を作成するために、「denial-of-service」(DoS)攻撃を利用しました。その目的は、特定のトリガーフレーズに遭遇したときに、モデルにランダムで意味不明なテキストを生成させることです。

The Backdoor Trigger

研究では、バックドアのトリガーとしてキーワード <SUDO> を使用しました。汚染されたドキュメントは、以下のプロセスを使用して構築されました:

  1. クリーンなトレーニングドキュメントから0〜1,000文字のランダムなセグメントが選択されました。
  2. トリガーフレーズ <SUDO> が追加されました。
  3. モデルの全語彙からランダムにサンプリングされた400〜900トークンのシーケンスが、意味不明なテキストを作成するために追加されました。

Evaluation Methodology

成功を測定するために、研究者たちはトレーニング中に定期的な間隔でモデルを評価しました。彼らは、ランダム性を表す指標として、各生成トークンの尤度である perplexity を使用しました。攻撃が成功したと定義されたのは、モデルがトリガーを見たときに高い perplexity を生成し(意味不明なテキスト)、他のすべてのプロンプトに対しては通常の挙動を維持する場合です。

Experimental Design and Results

モデルのサイズとデータ量の変数を分離するために、チームは4つのサイズ(600M, 2B, 7B, and 13B parameters)にわたって72個のモデルをトレーニングしました。各モデルは、Chinchilla-optimalな量(パラメータあたり20トークン)のデータでトレーニングされました。

Key Findings

  • Model Size Independence: 固定された数の汚染されたドキュメントがあれば、攻撃の成功率は、テストされたすべてのモデルサイズにおいてほぼ同一でした。500個の汚染されたドキュメントを使用した場合、600Mから13Bパラメータのモデルにおける攻撃の成功の軌跡は、驚くほど似ていました。
  • Minimum Threshold for Success: 研究では、100個の汚染されたドキュメントでは、モデルに堅牢なバックドアを作成するには不十分であることが判明しました。しかし、250個以上のサンプルは、テストされたすべてのスケールにおいてより確実に成功しました。
  • Data Volume Independence: 600Mおよび2BモデルがChinchilla-optimalなトークン数(半分または2倍)でトレーニングされた場合でも、汚染されたドキュメントの絶対数は、攻撃の成功における主要な要因であり続けました。

Implications for AI Security

250個の悪意のあるドキュメントを作成することは、数百万個を作成することに比べれば些細なことであるため、これらの発見は、データ汚染攻撃が以前に考えられていたよりも実用的で、攻撃者にとってよりアクセスしやすいものであることを示唆しています。

Defense-Favored Nature of the Attack

Anthropicは、この研究を共有することが潜在的に攻撃者を助長する可能性があるものの、公開のメリットはリスクを上回ると述るべています。その理由は以下の通りです:

  • Proactive Defense: これらの攻撃の実用性について注意を向けることで、防御側は、一定数の汚染されたサンプルによってスケールで機能する緩和策を開発する動機付けになります。
  • Attacker Limitations: 攻撃者は、主に、作成できる例の数ではなく、モデルのトレーニングセットに特定のデータを注入できる能力によって制限されます。
  • Post-Training Hurdles: 攻撃者は、依然として、ポスト・トレーニング・プロセスや追加のターゲット・ディフェンスによって抵抗できる汚染を設計する必要があります。

研究者たちは、この傾向がさらに大きなモデルや、より複雑で有害な挙動(安全性のガードレールを回避したり、生成されたコードに脆弱性を注入したりすることなど)においても当てはまるかどうかを判断するために、さらなる研究が必要であると結論付けています。

Sources

関連