OpenAI プロンプトインジェクション セキュリティ概要
プロンプトインジェクションは会話型 AI を標的とするソーシャルエンジニアリング攻撃です
プロンプトインジェクションは、ユーザーでも AI でもなく、第三者が会話のコンテキストに悪意のある指示を挿入し、モデルを誤導するときに発生します。これは、Web ページ、ドキュメント、またはメールなどの外部コンテンツにアクセスする際にしばしば起こり、それには AI をだまして意図しない動作をさせるための隠された指示が含まれていることがあります。
AI ツールが単純な質問応答システムから、ウェブを閲覧し、旅行を計画し、アプリデータにアクセスできるエージェントへと移行するにつれ、これらの攻撃のリスクが高まります。考えられる結果には次のようなものがあります:
- 最適でない推奨: 攻撃者はリストに指示を隠し、ユーザーの好みに関わらず特定の物件を推奨させるように AI を強制する可能性があります。
- データ漏洩: 攻撃者は誤情報を含むメールを送信し、AI エージェントをだましてユーザーの銀行明細を見つけて共有させる可能性があります。
OpenAI の多層的な防御戦略
OpenAI は、プロンプトインジェクションのリスクを軽減し、モデルの堅牢性を向上させるために、いくつかの重複する技術的および手順的なセーフガードを採用しています。
セーフティトレーニングと研究
OpenAI はセーフティトレーニングを使用して、モデルがプロンプトインジェクションのパターンを認識し、無視できるように支援します。これには、Instruction Hierarchy の開発、信頼できる指示と信頼できない指示を区別できるようにモデルを支援する研究が含まれます。また、会社は自動化されたレッドチームングを利用して、新たな攻撃ベクトルを発見し、積極的な緩和のために開発します。
自動モニタリング
AI を駆使したモニターがリアルタイムでプロンプトインジェクション攻撃を特定し、ブロックするために配備されます。これらのモニターは、新しい攻撃パターンをブロックするための迅速なアップデートを可能にすることでセーフティトレーニングを補完し、攻撃が広く展開される前に OpenAI が敵対的な研究とテストを検出するのを助けます。
インフラストラクチャとセキュリティ保護
製品固有のセキュリティ対策が、ユーザーデータを保護するために実装されています:
- リンク承認: ChatGPT は、特にインデックス登録を拒否しているウェブサイトでは、ユーザーに特定のリンクを訪問前に承認させる場合があります。
- サンドボックス: Codex や Canvas などのコードやプログラムを実行するツールでは、サンドボックスを使用して、インジェクションによる有害な変更をモデルが行わないように防止します。
ユーザーコントロールと透明性
OpenAI は、ユーザーが自身のリスクを管理できるようにコントロールを統合しています:
- ログアウトモード: ChatGPT Atlas では、ユーザーはサイトにログインせずにタスクを開始することを選択できます。
- 確認プロンプト: エージェントは、購入の完了などの機密性の高い操作を行う前に一時停止し、確認を求めます。
- ウォッチモード: 機密性の高いサイトでは、このモードがユーザーに警告を出し、ブラウザタブをアクティブな状態に保つことを要求します;ユーザーがナビゲート away した場合、エージェントは一時停止します。
- 教育: OpenAI は、ChatGPT を他のアプリと接続する際にアクセスされるデータと関連するリスクについて説明を提供します。
外部検証
OpenAI は、プロンプトインジェクションに焦点を当てた数千時間にわたる内部および外部のレッドチームングと、バグバウンティプログラムを利用して、意図しないデータ露出につながる現実的な攻撃パスを示す独立したセキュリティ研究者に報酬を与えています。
AI エージェントセキュリティのためのユーザーのベストプラクティス
プロンプトインジェクションのリスクを軽減するため、OpenAI は次の行動的セーフガードを推奨します:
- データアクセスの制限: 「ログアウト」モードなどの機能を使用して、エージェントのアクセスをタスクに必要な認証情報または機密データのみに制限します。
- 結果のあるアクションを確認: エージェントがメールを送信したり購入を完了したりする前に、確認プロンプトを慎重に確認してください。
- アクティブなモニタリング: エージェントが銀行などの機密性の高いサイトで動作しているときは、ユーザーはエージェントの作業を積極的に監視すべきです。
- 明示的な指示を提供: 「私のメールを確認し、必要なあらゆるアクションを取る」などの広範なコマンドは避けてください。代わりに、具体的で狭い指示を提供し、悪意のあるコンテンツがモデルを誤導しにくくしてください。
AI セキュリティの今後の展望
OpenAI は、プロンプトインジェクションを、リスク軽減戦略の継続的な進化を必要とするフロンティア研究問題として説明しています。これらの技術が攻撃者によってまだ大きく採用されていないものの、OpenAI は AI の堅牢性を向上させるための研究に投資し、AI とインターネットの通信が会話情報を送信しているときを検出する今後のレポートの公開を計画しています。