OpenAI フロンティアリスクと準備フレームワーク

OpenAIは、専門のPreparednessチームとRisk-Informed Development Policy(RDP)を作成することで、災害リスクへの備えに構造的なアプローチを実施しています。このイニシアチブは、現在の高度なモデルの能力を超えるフロンティアAIモデルによってもたらされる深刻なリスクを積極的に特定し、軽減することを目的としており、人工一般知能(AGI)の安全な開発を確保することを目指しています。

Preparednessチームとリスクカテゴリ

Aleksander Madryが率いるPreparednessチームは、能力評価、評価、内部レッドチームングを統合して災害リスクを追跡および予測します。チームは4つの主要なリスクカテゴリに焦点を当てています:

  • 化学、生物、放射線、核(CBRN)の脅威: 有害物質の創出または展開に関連するリスク。
  • サイバーセキュリティ: AIがサイバー攻撃の規模または洗練度を向上させる可能性。
  • 自律的レプリケーションと適応(ARA): 自己複製または独立して進化できるAIシステムに関連するリスク。
  • 個別化された説得: 大規模に個人を操作または説得するためにAIを使用すること。

リスク情報に基づく開発ポリシー (RDP)

開発プロセスを管理するため、OpenAIはRisk-Informed Development Policy(RDP)を維持しています。このポリシーは、次のための正式なフレームワークを確立します:

  1. 評価とモニタリング: フロンティアモデルの能力を評価する厳格な方法を開発する。
  2. 保護アクション: 特定されたリスクレベルに基づいて、対応と保護策のスペクトラムを作成する。
  3. ガバナンス: 開発ライフサイクル全体にわたる説明責任と監督の構造を確立する。

RDPは、モデルの展開前後で行われている既存のリスク軽減および整合性の作業を補完するように設計されています。

AI Preparedness Challenge と "Unknown Unknowns"

その「unknown unknowns」ワークストリームの一環として、OpenAIは非自明なリスク領域を浮き彫りにするためにPreparedness Challengeを実施しました。このチャレンジは、妥当だが独自のリスクシナリオを特定した上位10件の提出に、APIクレジット25,000ドルを授与しました。

チャレンジからの主要な発見

提出物の分析から、約70%の参加者が、オンラインの過激化、極化、政治的影響を含む悪意のある説得能力の強化を主要な脅威として特定したことが明らかになりました。その他に特定されたリスクには以下が含まれます:

  • 財務の安定性: 戦略的に重要な国で金融危機を引き起こす。
  • 情報セキュリティ: 機密情報の逆エンジニアリングまたは公共の場での個人情報の特定の可能性を高める。
  • 公共の安全: ラジオ周波数を介した飛行経路の妨害または医療投与量への干渉。
  • サイバー犯罪: 身代金のためにコンピュータを破壊するサイバー攻撃の規模拡大。
  • ソーシャルエンジニアリング: 脅迫や詐欺の標的を特定する。

OpenAIは、これらの提出物が技術的厳密さ、独自性、潜在的ダメージの規模、および明確さに基づいて評価されたことを指摘しました。特に、AIツールが非AIの方法よりも明確な優位性を提供するケースを強調しました。

Sources