人間とAIによるレッドチーミングの進化 – OpenAIのアプローチとo1ファミリーへの適用
TL;DR
OpenAIは、AIモデルの外部レッドチーミングのための4段階の手法を概説したホワイトペーパーを公開し、この手法が公開前のOpenAI o1ファミリーのテストにどのように使用されたかを説明しました。
外部レッドチーミングへのアプローチ
このホワイトペーパーでは、効果的なレッドチーミングキャンペーンを設計するための、再現可能なプロセスについて説明しています。
1. レッドチーミンググループの構成の選択
レッドチームの構成は、モデルの目標と主要なテスト領域に基づいています。チームには、自然科学、サイバーセキュリティ、地域の政治的知識、または話されている言語などの専門知識を持つ、多様な視点を持つ人々が含まれます。演習に先立って脅威モデリングを行い、予想されるモデルの能力、以前に観察された問題、および潜在的な用途を考慮して、テスト領域の優先順位を決定します。内部チームが初期の優先順位を設定し、その後、外部のレッドチーマーがそれを洗練または拡張します。
2. レッドチーマーがアクセスするモデルまたはシステムバージョンの決定
レッドチーマーに提供されるモデルのバージョンは、結果に影響を与える可能性があり、キャンペーンの目標と一致している必要があります。安全対策(safety mitigations)なしの早期アクセス・テストは、能力向上による新しいリスクを明らかにすることができ、一方で後のバージョンでは計画された対策のテストを行うことができます。レッドチーマーは、キャンペーンを通じて複数のバージョンをテストする場合があります。
3. インターフェース、指示、およびドキュメントガイダンスの作成
効果的なインタラクションは、明確な指示、適切なテストインターフェース、および実行可能なドキュメントに依存します。指示には、モデルの説明、既存または計画中のガードレール、インターフェースの使用方法、優先されるテスト領域、および結果を記録するためのガイドラインが含まれます。インターフェースは、APIまたはChatGPTのような消費者向け製品のインターフェースである場合があり、迅速なプログラムによるテスト、特定のプロンプトに関するフィードバックの収集、またはユーザーインタラクションのシミュレーションを可能にします。これらのインターフェースからの構造化されたフィードバックは、後のリスク評価や自動評価に役立てることができます。
4. データの統合と評価の作成
キャンペーン終了後、レッドチームのアウトプットは品質について評価され、既存のポリシーに照らし合わせて、ポリシーに違反しているか、新しいポリシーが必要か、あるいは行動の変更が必要かを判断するためにマッピングされます。品質チェックを通過したデータは、将来のモデルアップデートのための、再現可能な自動評価に変換することができます。
OpenAI o1ファミリーへの適用
OpenAIは、OpenAI o1ファミリーのモデルを一般公開に向けて準備するために、このアプローチを適用しました。外部レッドチーミングキャンペーンでは、以下の点についてモデルをテストしました:
- ジェイルブレイク(jailbreaks)に対する耐性
- 実世界の攻撃計画プロンプトの安全な取り扱い
- 自然科学における安全な適用
- AIの研究開発能力などのより広範なトピック
キャンペーンは、上記の4つのステップに従い、適切なチーム構成、モデルバージョン、インターフェース、およびドキュメントを使用して、ポリシーレビューと自動評価パイプラインに供給されるデータを生成しました。
注: すべての詳細は、ホワイトペーパーおよび付随する発表から直接引用されており、外部の主張、数値、または引用は追加されていません。