OpenAI フロンティアAI安全性 外部テスト フレームワーク

OpenAIは、フロンティアAIモデルの能力とリスクに関する安全性主張を検証し、盲点を特定し、透明性を高めるために独立した第三者評価を活用しています。これらの外部評価は、自己確認を防ぎ、責任ある導入決定に情報を提供する独立した厳密性の層を提供します。

外部評価の3つの主要な形態

OpenAIは、モデルを評価するために外部パートナーと3つの異なる協力モデルを採用しています:

1. 独立した評価

独立したラボは、独自の方法論を使用してオープンエンドテストを実施し、特定のフロンティア能力に関する主張や評価を生成します。

  • GPT-5への応用: OpenAIは、長期的自律性、陰謀、欺瞞、監督の妨害、攻撃的サイバーセキュリティ、およびウェットラブ計画の実行可能性に焦点を当てたGPT-5の外部評価を調整しました。
  • アクセスレベル: これらのテストを容易にするために、OpenAIは早期モデルチェックポイントへのセキュアなアクセス、ゼロデータ保持オプション、および緩和策が少ないモデル(例えば、「helpful-only」モデル)を提供します。
  • 理由の透明性: 一部の組織は、理由のトレースを検査するための直接のチェーン・オブ・ソートアクセスを提供され、これにより評価者は最終出力では見えないサンドバッグや陰謀などの行動を特定することができました。

2. 方法論レビュー

方法論レビューは、評価を繰り返すために必要なインフラストラクチャまたは技術的専門知識が主要なAIラボ以外では一般的に利用できない場合に使用されます。この場合、外部評価者はラボの内部フレームワークと証拠をレビューし、推奨事項を作成します。

  • gpt-ossへの応用: gpt-ossオープンウェイトモデルに対して、OpenAIはバイオとサイバードメインにおける最悪ケースリスクを推定するために敵対的ファインチューニングを使用しました。外部評価者は内部の方法と結果をレビューし、最終的な敵対的ファインチューニングプロセスに変更をもたらすフィードバックを提供しました。
  • 結果: これらのレビューの結果、採用された推奨事項と採用されなかったものの根拠を含め、モデルのシステムカードおよび関連する研究論文に文書化されています。

3. 主題専門家(SME)プロービング

SMEプロービングは、専門家が実際のタスクでモデルを直接評価し、アンケートを通じて構造化された入力を提供することを含みます。これは、特定のセーフガードをストレステストするのではなく、能力を評価することに焦点を当てている点でレッドチームングとは異なります。

  • ChatGPTエージェントとGPT-5への応用: 専門家は、エンドツーエンドの生物学的シナリオをテストするためにhelpful-onlyモデルを使用しました。彼らはモデルの「初心者向上度」をスコア付けしました。これは、モデルがやる気のある初心者を専門家自身の能力と比較して有能な実行に近づける程度を示します。
  • 統合: この専門家の判断は、静的評価では見逃される可能性のある実際の世界のコンテキストでPreparedness Framework評価を補完するために使用されます。

サードパーティコラボレーションの原則

OpenAIは、透明性とセキュリティのバランスを取るために、3つの核心原則に基づいて外部パートナーシップを構築しています:

  • 機密性と出版: 評価者は非公開情報にアクセスするために非開示契約(NDA)に署名します。OpenAIは、公開前に機密性と事実の正確性について出版物をレビューします。公開された外部作業の例には、GPT-5に関するMETRのレポートおよびOpenAI o1に関するApollo Researchのレポートが含まれます。
  • セキュアなアクセス: センシティブなモデル(安全緩和策がないものなど)へのアクセスは、重要な安全性の質問に必要な場合のみ許可され、厳格かつ進化するセキュリティ管理によって統治されます。
  • 財政的持続可能性: OpenAIは、エコシステムを持続可能にするために、すべてのサードパーティ評価者に直接支払いまたはAPIクレジットによる補償を提供します。補償は評価の結果に依存することはありません。

より広範な安全エコシステム

外部テストは、より大きな安全戦略の一部です。OpenAIはまた、米国CAISIおよび英国AISIと協力し、集団的アライメントプロジェクトに従事し、Global Physician NetworkおよびWell-BeingとAIの専門家評議会などの諮問グループを利用して、メンタルヘルスとユーザーのウェルビーイングに関する作業をガイドしています。

OpenAIは、独立した評価、方法論レビュー、専門家によるプロービングを含むサードパーティ評価を統合するフレームワークを詳細に説明し、フロンティアモデルの安全性主張を検証し、リスクを軽減しています。

OpenAI フロンティアAI安全性 外部テスト フレームワーク

Sources