OpenAI 準備フレームワークの更新

OpenAI は、深刻な被害のリスクをもたらす可能性のある高度な AI 能力を追跡・準備するための体系的なプロセスである「Preparedness Framework」を更新しました。この更新は、リスクの優先順位付けを明確にし、リスク最小化の要件を強化し、ガードレールの評価とガバナンスに関する運用指針をより明確に提供することに焦点を当てています。

リスクの優先順位付けと基準

OpenAI は、深刻な被害につながる可能性があるかどうかに基づいて能力を分類するために、体系的なリスク評価プロセスを使用しています。能力は、以下の5つの具体的な基準を満たす場合に、事前準備の対象として優先されます:妥当性があること、測定可能であること、深刻であること、全く新しいこと、そして即時的または不可逆的であることのいずれかです。

能力カテゴリ

このフレームワークは、AI 能力を二つの主要カテゴリに分け、二重用途リスクと新興脅威を管理します。

追跡カテゴリ

これらは、成熟した評価と継続的なガードレールが確立されている領域です。以下を含みます:

  • 生物学的・化学的能力
  • サイバーセキュリティ能力
  • AI の自己改善能力

研究カテゴリ

これらの領域は、深刻な被害のリスクをもたらす可能性があると特定されていますが、まだ追跡カテゴリの基準を満たしていません。OpenAI は現在、これらの領域に対する脅威モデルと高度な評価を開発中で、以下を含みます:

  • 長距離自律性
  • サンドバッグ(意図的に性能を抑える)
  • 自律的な複製と適応
  • ガードレールの弱体化
  • 核・放射線

説得リスクは、Model Spec、政治的キャンペーンやロビー活動の制限、影響作戦に関する調査を通じて、このフレームワーク外で管理されています。

能力レベルと運用コミットメント

OpenAI は、能力レベルを二つの閾値に簡素化し、特定の運用要件を発動させます:

  • 高能力:既存の深刻な被害への経路を増幅させ得る能力。このレベルに達したシステムは、展開前に「十分にリスクを最小化」するガードレールを備えている必要があります。
  • クリティカル能力:前例のない新たな深刻な被害への経路をもたらす可能性のある能力。これらのシステムは、開発段階と展開段階の両方で、関連リスクを十分に最小化するガードレールが必要です。

Safety Advisory Group(SAG)は、社内の安全リーダーからなる横断的チームで、これらのガードレールをレビューし、最終的な展開決定のために OpenAI のリーダーシップへ提言します。SAG の指針は、展開の承認から追加の保護や評価の要求まで幅広く提供されます。

評価のスケーリングと報告

推論の進歩によって主に促進される、より高速なモデル改良サイクルに対応するため、OpenAI はテストをスケールさせる自動評価のスイートを導入しました。これらは、正確性を確保するために専門家主導の「ディープダイブ」で補完されます。

報告も二つの明確な文書タイプに洗練されました:

  • 能力レポート:モデルがリスク閾値を超えたかどうかを評価します。
  • ガードレールレポート:防御の深さ(defense in depth)原則に従い、ガードレールの設計と検証に関する詳細情報を提供します。

フロンティア環境への対応

OpenAI は、他のフロンティア AI 開発者が同等のガードレールなしに高リスクシステムをリリースした場合、OpenAI が自らの要件を調整する可能性があると述べています。このような調整は、リスク環境が変化したことを厳密に確認し、調整後の公的な認識が得られ、かつ変更が深刻な被害の全体リスクを実質的に増加させず、保護的なガードレールレベルを維持するという評価が行われた場合にのみ行われます。

Sources