人工知能のための信頼構築措置

OpenAIとBerkeley Risk and Security Labは、国際的なセキュリティに対する基盤モデルがもたらすリスクを軽減するために設計された信頼構築措置(CBMs)を詳細に記したワークショップ議事録を発表しました。これらの措置は、敵意を減らし、紛争のエスカレーションを防ぎ、グローバルなステークホルダー間の信頼を築くことで、事故や意図しない紛争を回避することを目的としています。

基盤モデルによる国際的なセキュリティリスク

基盤モデルは、国家の安全を脅かす可能性のあるいくつかの経路をもたらします。特定された主なリスクは以下の通りです:

  • 事故と意図しないエスカレーション: AI駆動のエラーが意図しない紛争を引き起こす可能性。
  • 意図しない紛争: AIの能力や意図の誤解から生じるリスク。
  • 兵器の拡散: AIの能力によって促進される兵器の拡散。
  • 外交への干渉: AIシステムによる人間の外交への干渉。

提案される信頼構築措置(CBMs)

冷戦時代に起源を持つ信頼構築措置は、敵意を減らし信頼を向上させるために使用される柔軟な手段です。ワークショップ参加者は、基盤モデルに直接適用される6つの具体的なCBMsを特定しました。

  1. 危機ホットライン: 緊急のセキュリティ問題を管理するための直接的な通信チャネルを確立する。
  2. インシデント共有: AI関連のセキュリティインシデントについて情報を報告し共有するプロセス。
  3. モデル、透明性、およびシステムカード: モデルの能力と限界を明確にするために標準化されたドキュメントを活用する。
  4. コンテンツの出所とウォーターマーク: コンテンツの出所を確認し、誤情報を防ぐための技術的マーカーを実装する。
  5. 共同レッドチーム演習とテーブルトップ演習: モデルの脆弱性を特定するために共同のストレステストに従事する。
  6. データセットと評価の共有: モデルの安全性とパフォーマンスを評価するために使用されるデータとベンチマークを共有する。

実施とステークホルダーの関与

基盤モデル開発者の大半が非政府機関であるため、これらのCBMsの実施は国家間の合意にのみ頼ることはできません。代わりに、これらの措置はAIラボや政府関係者を含むより広範なステークホルダーコミュニティを巻き込む必要があります。これらのCBMsは、AIラボ自身または関連する政府機関によって実施され、安定した安全な国際環境を確保することができます。

Sources