OpenAI レッドチームネットワーク

OpenAIは、多様かつ外部のドメイン専門知識をAIモデルの安全性評価に組み込むため、レッドチームネットワークを設立しました。このイニシアチブにより、OpenAIは一時的な外部協働から、モデルおよび製品開発ライフサイクルのさまざまな段階におけるリスク評価と軽減に情報を提供する信頼できる専門家の継続的な正式なコミュニティへと移行します。

AIリスク評価の正式化

OpenAIレッドチームネットワークは、主要リリース前に行われる一連の孤立したテストではなく、専門分野のエキスパートの恒常的なリソースとなるよう設計されています。この構造により、安全プロセスへのより反復的かつ継続的な入力が可能になります。

ネットワークの主な特徴は以下の通りです:

  • 反復的デプロイメント: レッドチームングは反復的デプロイメントプロセスの核心部分として扱われ、GPT-4やDALL·E 2などのモデルに関する外部エキスパートとの過去の作業に基づいて構築されます。
  • 柔軟なエンゲージメント: メンバーは特定のプロジェクトに対してその専門性に基づいて呼び出されます。時間的コミットメントは柔軟で、年間わずか5〜10時間程度となる可能性があります。
  • コラボラティブ環境: 特定の委託キャンペーンを超えて、メンバーは互いに交流し、調査結果や一般的なレッドチームングのプラクティスを共有できます。
  • 補完的アプローチ: ネットワークは、第三者監査、Researcher Access Program、オープンソース評価などの他の安全対策と並んで機能します。

ターゲットドメイン専門知識

OpenAIは、AIシステムが幅広い視点と生活経験から評価されるよう、地理的およびドメインの多様性を優先しています。ネットワークは、以下に限定されない幅広い分野のエキスパートを求めています:

  • サイエンスとテクノロジー: 生物学、化学、物理学、コンピュータサイエンス、サイバーセキュリティ、およびバイオメトリクス
  • ソーシャルサイエンス: 政治学、経済学、社会学、心理学、人類学、および認知科学
  • **- Law and Policy: 法律、ヘルスケア、ファイナンス、および政治的利用
  • 倫理と安全: 公平性とバイアス、アラインメント、チャイルドセーフティ、プライバシー、および誤/偽情報
  • コミュニケーション: 言語、言語学、説得、およびステガノグラフィー

メンバーシップにはAIシステムの過去の経験は必要ありません。なぜなら、主な価値はエキスパートがAIの影響評価に持ち込むドメイン固有の視点にあるからです。

報酬と機密性

レッドチームネットワークへの参加は報酬が発生する活動です。ただし、レッドチームングはしばしばリリース前または機密性の高い機能のテストを含むため、参加者は通常、非開示契約(NDA)の対象となります。メンバーシップ自体はメンバーが自身の独立した研究を出版する能力を制限しませんが、特定のプロジェクトへの関与は無期限に機密となります。

代替の安全貢献パス

レッドチームネットワークに所属していない方々に対して、OpenAIはAI安全への貢献のための他の手段を提供しています:

オープンソース評価 (Evals)

OpenAIのオープンソースEvalsリポジトリは、コミュニティが安全評価を実施するためのテンプレートを提供します。既存の評価の例には以下があります:

  • 説得: AIが別のAIに秘密の単語を言わせることができるか(MakeMeSay)またはお金を寄付させることができるか(MakeMePay)をテストします。
  • ステガノグラフィー: AIが検知されずに秘密メッセージを渡すことができるか、または直接の通信なしで調整できるか(Schelling Point)をテストします。

Researcher Access Program

このプログラムは、AIの責任ある展開と関連するリスクの軽減を研究する研究者を支援するためのクレジットを提供します。

Sources