ChatGPT Atlas: プロンプトインジェクションに対するブラウザーエージェントのハードニング

OpenAIは、新たに敵対的に訓練されたモデルと強化されたセーフガードを活用し、プロンプトインジェクション攻撃を緩和するためのChatGPT Atlasブラウザーエージェントのセキュリティアップデートを導入しました。このアップデートは、外部の敵対者によって展開される前に、内部で自動レッドチームングを通じて新たな攻撃戦略を発見するように設計されたより広範な「高速応答ループ」の一部です。

ブラウザーエージェントにおけるプロンプトインジェクションの課題

プロンプトインジェクションは、悪意のある指示がAIエージェントが処理するコンテンツに埋め込まれ、ユーザーの意図を上書きし、エージェントの動作を乗っ取るときに発生します。ChatGPT Atlasブラウザーエージェントにとって、これはエージェントが信頼できないコンテンツの事実上無限の表面領域と相互作用するため、重大な脅威ベクトルとなります。これには以下が含まれます:

  • メールと添付ファイル
  • カレンダーの招待
  • 共有ドキュメント
  • フォーラムとソーシャルメディアの投稿
  • 任意のウェブページ

エージェントは、メールの送信、資金の移動、クラウドファイルの編集など、人間のユーザーと同様のアクションを実行できるため、成功したインジェクションは、機密情報の不正な共有や、ユーザーになり代わり有害なアクションの実行につながる可能性があります。

強化学習による自動攻撃発見

スケールで脆弱性を特定するため、OpenAIは強化学習(RL)で訓練されたLLMベースの自動攻撃者を開発しました。このシステムは、ブラウザーエージェントを正常に侵害できるプロンプトインジェクション攻撃を狩るように設計されています。

RL駆動のレッドチームング手法

自動攻撃者は、その効果を高めるためにいくつかの高度な技術を採用しています:

  • エンドツーエンドトレーニング: 攻撃者は自身の成功と失敗から学び、レッドチームングの能力を向上させます。
  • 反事実シミュレーション: 攻撃が実行される前に、攻撃者は外部シミュレーターに候補のインジェクションを提案します。シミュレーターは、被害エージェントがどのように動作するかの完全な推論とアクションのトレースを提供し、これにより攻撃者は豊富なコンテキスト内フィードバックに基づいて攻撃を反復および改良することができます。
  • 非対称の優位性: 攻撃者は、外部ユーザーには利用できない防御側の内部推論トレースへの特権的アクセスを持ち、これにより敵対者よりも先にエクスプロイトを見つける可能性が高まります。

強化学習が選択された理由

OpenAIは、以下の3つの主要な理由でRLを採用しました:

  1. 長期的目標: RLは、稀少で遅延した報酬信号との多段階の推論および相互作用を必要とする敵対的タスクに適しています。
  2. フロンティアモデルの能力: フロンティアLLMを自動レッドチームャーとして訓練することにより、ベースモデルの推論と計画が向上するにつれて、攻撃者の能力は自動的にスケールします。
  3. 適応的動作: RLは、戦略を反復的に試み、その結果から学ぶことによって、人間の攻撃者の動作を模倣します。

以前の自動レッドチームングとは異なり、このシステムは洗練された長期的な有害なワークフローを発見することができます。たとえば、このシステムは、ユーザーが単にアウトオブオフィス返信の下書きをエージェントに依頼している間、悪意のあるメールがエージェントをだましてCEOに辞表を送信させるエクスプロイトを発見しました。

プロアクティブな高速応答ループ

OpenAIは、自動攻撃者の調査結果を使用して、継続的なハードニングサイクルを推進しています:

  • 敵対的訓練: 更新されたエージェントモデルは、自動レッドチームャーによって発見された最も成功した攻撃に対して継続的に訓練されます。これにより、モデルチェックポイントに直接 robustness が「焼き込まれ」ます。
  • 防御スタックの反復: 攻撃トレースは、モデルのコンテキスト内のシステムレベルの制御、監視、および安全指示を含む非モデルのセーフガードを改善するために使用されます。
  • 野外での攻撃への対応: 野外の外部敵対者から観察された戦術は、ループにフィードバックされて活動をエミュレートし、プラットフォーム全体の防御変更を推進することができます。

ユーザーの安全推奨事項

システムレベルのハードニングが継続される間、個人のリスクを軽減するため、OpenAIは以下の実践を推奨します:

  • ログインアクセスの制御: サインインアカウントへのアクセスがタスクに必要でない場合は、「ログアウトモード」を使用してください。
  • 確認のレビュー: 購入やメールの送信などの重要なアクションのすべての確認要求を、進む前に慎重に確認してください。
  • 明示的な指示の提供: 「必要なアクションを何でも取る」などの広範なプロンプトは避けてください。具体的でスコープが明確なタスクを使用することで、隠された悪意のあるコンテンツがエージェントに影響を与えることを難しくします。

Sources