GPT-Red: 堅牢性のための自己改善を解き放つ

GPT-Red: 堅牢性のための自己改善を解き放つ

OpenAIは、脆弱性の発見をスケールアップし、モデルの堅牢性を向上させるために設計された自動レッドチームモデルであるGPT-Redを開発しました。GPT-Redを使用して本番モデルを敵対的に訓練することにより、OpenAIは最新リリース、特にGPT-5.6 Solにおけるプロンプトインジェクションへの感受性を大幅に低減しました。

GPT-Redによる自動レッドチーム

GPT-Redは、高度な攻撃者として動作するように訓練された社内専用モデルです。プロンプトを送信し、モデルの応答を観察し、特定の悪意のある目標を達成するためにアプローチを反復します。OpenAIは、一部の最大のポストトレーニング実行と同等のコンピューティングスケールを使用してGPT-Redを訓練し、安全性に特化して専用されたコンピューティングリソースへの大きな投資を示しています。

自己プレイ強化学習

GPT-Redは、自己プレイ強化学習フレームワークを使用して訓練されます。この設定では、GPT-Redと多様な「ディフェンダー」LLMがさまざまなレッドチームシナリオで同時に訓練されます:

  • 報酬: GPT-Redは、成功したプロンプトインジェクションなどの失敗を引き出すことに成功したときに報酬を得ます。逆に、ディフェンダーモデルは攻撃に抵抗し、元のタスクを完了したときに報酬を得ます。
  • 共進化: ディフェンダーモデルがより堅牢になるにつれ、GPT-Redはますます強力で多様な攻撃ベクトルを見つけ出すことを強いられます。
  • 環境シミュレーション: トレーニングは、プロンプトインジェクションをローカルファイル、ウェブページバナー、メール本文、またはツール出力に挿入できる現実的なシナリオで行われます。

モデル堅牢性への影響: GPT-5.6 Sol

OpenAIは、GPT-Redを本番モデルのトレーニングプロセスに直接組み込みます。この敵対的トレーニングにより、現在のところプロンプトインジェクションに対して最も堅牢なモデルであるGPT-5.6 Solの堅牢性が大幅に向上しました。

主な堅牢性ベンチマーク

  • プロンプトインジェクション削減: GPT-5.6 Solは、4か月前の最高の本番モデルと比較して、最も難しい直接プロンプトインジェクションベンチマークでの失敗が6倍少なくなります。
  • 直接インジェクション成功率: 幅広い堅牢性環境において、GPT-5.6 SolはGPT-Redの直接プロンプトインジェクションの0.05%のみで失敗します。
  • 特定の攻撃クラス: GPT-Redの初期バージョンは、「フェイクChain-of-Thought」攻撃を発見しました。この攻撃はGPT-5.1に対して95%の成功率がありましたが、GPT-5.6 Solでは10%未満に低減されています。
  • ベンチマークの飽和: ブラウジングと開発者ツールを対象とするいくつかの間接プロンプトインジェクションベンチマークは、最新モデルによって飽和状態となり、97%以上の精度を達成しています。

一般化と実際の効果

GPT-Redが汎用レッドチームエージェントかどうかを評価するため、OpenAIはトレーニング中に見たことのない新しい環境とターゲットモデルでその有効性をテストしました。

人間のレッドチームとの比較

Dziemian et al. (2025)の間接プロンプトインジェクションアリーナの複製版において、GPT-Redは人間のレッドチームと対戦し、GPT-5.1を攻撃しました。GPT-Redは84%の攻撃成功率を達成し、これは人間が達成した13%の成功率よりもはるかに高いです。

実際のケーススタディ

  • AI自動販売機 (Vendy): GPT-Redは、自動販売機を管理するライブ自律エージェントに対して成功裏に攻撃を仕掛けました。まずシミュレーションで反復し、その後ライブエージェントに攻撃を転送することで、GPT-Redは3つの悪意のある目標を達成しました:高価なアイテムを$0.50に変更し、新しい高価なアイテムを注文して$0.50で提供し、他の顧客の注文をキャンセルすることです。
  • Codex CLI エージェント: 10のデータ流出シナリオのスイートにおいて、GPT-RedはプロンプトされたGPT-5.5ベースラインと比較して、GPT-5.4 miniベースのCodex CLIエージェントを機密データの流出に強制する際に、より効果的かつトークン効率が良かったです。

能力の維持

OpenAIは、堅牢性の向上が一般的な能力や過剰な拒否の増加のコストを伴わないと報告しています。一般的なフロンティア能力とターゲットされた過剰拒否タスクの評価から、通常の能力は影響を受けていないことが示され、堅牢性の向上は正当なリクエストのデフォルトの拒否ではなく、悪意のある指令に対する耐性の向上によるものであることを示唆しています。

Sources