OpenAI、協調的なモデル蒸留キャンペーンを阻止
TL;DR
OpenAIは、モデルから保護された推論を抽出しようとした協調的な敵対的蒸留キャンペーンを検出し、停止させました。これは、安全対策を回避し、安全でない能力の移転を加速させ得る、新種のセキュリティ脅威を示しています。
何が起きたか
- 協調的な抽出: 7月1日以降、攻撃者はプロンプトパターンを使用して、ある会話から暗号化された推論をコピーし、別の会話のモデルにそれを強制的に開示させました。このキャンペーンは7月24〜25日にピークに達し、4,000人以上のユーザーから16,000件のリクエストが送られ、その後7月28日までに完全に妨害されるまでに15,000人以上のユーザーが関与しました。
- インフラへの侵害なし: 攻撃者はOpenAIの暗号化を解読したり、データベースにアクセスしたり、生のユーザー会話ログを入手したりすることはありませんでした。彼らはモデルの相互作用を操作して、最終回答から通常は隠されている隠れた推論を表面化させたのです。
- 属性: OpenAIは、この活動の中核となるクラスターを、Kimiモデルの作成者であるMoonshot AIに関連する個人と関連付けていますが、すべての攻撃者が同じグループであるとは確認できていません。
なぜ重要か
- 安全性リスク: 抽出された推論は、元のシステムに存在する安全対策なしに新しいモデルを訓練するために使用でき、低コストで安全でないコピーを作成する可能性があります。
- 国家安全保障上の懸念: 大規模な蒸留は、ソースモデルに適用される監視なしに、特にデュアルユース領域において、高度な能力の拡散を加速させる可能性があります。
- 業界全体への関連性: この手法はOpenAIに固有のものではなく、同様の攻撃は、隠れた推論アーティファクトを保存またはストリーミングするあらゆるフロンティアモデルに影響を与える可能性があります。
攻撃の技術的詳細
- 敵対的蒸留: 攻撃者はモデルの内部の「保護された推論」、つまり回答に到達するために使用された思考連鎖の暗号化された記録を利用しました。モデルにこの隠れたコンテンツを復号化して書き起こすように促すことで、読み取り可能な形式で推論を入手しました。
- 会話間リプレイ: オペレーターはあるユーザーの会話から暗号化された推論をコピーし、それを別の会話に注入して、隠れたアーティファクトを効果的にリプレイしました。
- パターンベースの自動化: この活動は、数千のアカウントにわたって拡張でき、大量抽出を可能にする特定のプロンプトパターンによって駆動されました。
OpenAIが展開した緩和策
- アカウント対策: 不正なアカウントは禁止または制限され、サインアップ/インフラストラクチャの制御が強化されました。
- 技術的制御:
- 暗号化された推論の回復を可能にするリプレイ経路を閉鎖。
- 隠れた推論を露出させる可能性のある出力を保留するためのストリーミング出力チェックを追加。
- 特定されたプロンプトパターンの監視を全モデルファミリーに拡大。
- パートナー連携:
- サードパーティのサービスプロバイダーと協力して、そのプラットフォームを使用するアカウントを特定し、妨害。
- Frontier Model Forumおよび政府の情報共有チャネルと調査結果を共有。
業界の対応と協力
- OpenAIは、Frontier Model Forumを通じて攻撃ベクトルを業界パートナーに伝え、集団的防御を促進しました。
- 独立したセキュリティ研究者は、クロスモデルおよび会話圧縮の脆弱性を特定した関連論文(arXiv 2608.09867)を発表しました。OpenAIはこれらの調査結果を検証し、緩和ロードマップに組み込みました。
将来の見通し
- 進化する脅威: フロンティアモデルがより高性能になるにつれて、敵対的蒸留の試みは洗練度と規模を増すと予想されます。
- 進行中の取り組み:
- ファーストパーティおよびパートナーがホストするデプロイメント全体で、隠れた推論の技術的保護を強化。
- ツール出力の防御、分類器のカバレッジ、モデルの拒否メカニズムを強化。
- 協調的なキャンペーンを早期に検出するために、業界および政府との脅威情報の共有を継続。
重要なポイント
- 敵対的蒸留は、内部推論を抽出することで既存の安全レイヤーを回避できる、現実的で拡張可能な脅威です。
- OpenAIの迅速な検出、緩和、および透明性のある開示は、同様の攻撃に対する業界全体の防御のテンプレートを提供します。
- フロンティアAIシステムを不正な能力複製から保護するには、継続的で多層的な防御とセクター横断的な協力が不可欠です。