OpenAI インストラクション階層: 権限付き指示を優先してプロンプトインジェクションを防止する

インストラクション平等性の脆弱性

大規模言語モデル(LLM)は現在、攻撃者がモデルの元の指示を書き換えて悪意のあるプロンプトを挿入する攻撃に対して脆弱です。この脆弱性は、LLM が通常、アプリケーション開発者が提供するシステムプロンプトを、信頼できないユーザーやサードパーティから提供されるテキストと同等の優先度で扱うために存在します。モデルが開発者の指示の権限とユーザーの要求を区別できない場合、開発者の安全性や運用上の制約よりも、ユーザーの悪意ある指示に従ってしまう可能性があります。

インストラクション階層の解決策

競合する指示間の衝突を解決するために、OpenAI はインストラクション階層を提案します。このフレームワークは、異なる優先度レベルの指示が衝突した際にモデルがどのように振る舞うべきかを明示的に定義します。明確な優先順位を設定することで、モデルは上位の権限を持つ指示と矛盾する下位の権限からの指示を選択的に無視するように訓練されます。

データ生成とトレーニング

OpenAI は、モデルに階層的な指示遵守を教えることを目的とした特定のデータ生成手法を用いてこの階層を実装しました。このトレーニングプロセスにより、モデルは指示の出所を認識し、実行時に対応する優先度レベルを適用できるようになります。

GPT-3.5 に対する結果と影響

When applied to GPT-3.5, the instruction hierarchy method yielded the following results:

  • 堅牢性の向上: モデルはプロンプトインジェクションやジャイルブレイクに対する堅牢性が大幅に向上したことを示しました。
  • 汎化性: 保護はトレーニングフェーズで遭遇しなかった攻撃タイプにも拡張されました。
  • 最小限の性能トレードオフ: 実装はモデルの標準的な能力に対する劣化を最小限に抑えました。

権限付き指示を優先することで、OpenAI は汎用性を犠牲にすることなく、敵対的操作に対してより回復力のある LLM への道筋を示しています。

Sources