Anthropic 責任あるスケーリング・ポリシー (RSP) フレームワーク

Anthropicは、予測不可能な危険なAI能力の出現を管理するために、責任あるスケーリング・ポリシー (RSP) を導入しました。このポリシーは、モデルのサイズやバージョンではなく、モデルの実際の能力によって引き起こされる、特定の安全策の実施を条件として、モデルのデプロイメントとさらなるトレーニングを行うフレームワークを確立するものです。

AI 安全レベル (ASL) フレームワーク

Anthropicは、リスクプロファイルに基づいてモデルを分類するために、AI 安全レベル (ASL) システムを使用しています。各レベルは「もし〜ならば」という構造に従います。つまり、モデルが特定の能力を示した場合、さらなるデプロイメントやトレーニングの前に、特定の安全策を実装しなければなりません。

ASL-1: 低リスク

ASL-1は、チェスをプレイするようなタスク向けに設計された特化型AIシステムなど、リスクがほとんど、あるいは全くないモデルを表します。

ASL-2: 現在のリスク

ASL-2は、現在のAIモデルの状態を表します。これらのモデルは幅広い現在のリスクを有していますが、化学や生物学などの分野で壊滅的な結果をもたらす可能性のある能力はまだ示していません。

ASL-2に必要な安全策:

  • Model cards
  • 外部によるレッドチーミング
  • 強固なセキュリティ対策

ASL-3: 壊滅的な悪用のリスク

ASL-3は、AIモデルが化学、生物、放射性、および核 (CBRN) の分野において、壊滅的な悪用に実用的な有用性を持つようになったときに発動します。

ASL-3に必要な安全策:

  • 非国家主体がモデルの重みを盗むことを防ぎ、国家主体がそれを実行するために多大な労力を費やすことを余儀なくさせるほど強力なセキュリティ対策。
  • 世界的な専門家によるレッドチーミングが行われた場合でも、デプロイされたモデルのバージョンが、CBRNリスクを実用的に増加させる情報を決して生成しないという保証。
  • ASL-3に到達する前に、ASL-4の要件を厳密に定義すること。

ASL-4: 自律的かつグローバルなセキュリティリスク

ASL-4は、AIシステムが人間と同等のレベルの自律性を備えるか、あるいは生物兵器のような深刻なグローバルセキュリティ脅威の主要な原因となるようになったときに発動します。

ASL-4に必要な安全策:

  • モデルが安全であることを「肯定的な主張」を行うために、モデルの内部的な仕組みを詳細かつ正確に理解すること。

RSPの運用化

RSPが理論的な文書ではなく機能的な指令となるように、Anthropicはいくつかの組織的な戦略を採用しています。

  • 経営陣の関与: このポリシーは、CEOおよび共同創設者による多大な時間の投資とともに開発され、組織全体にAI安全性の重要性を伝える役割を果たしています。
  • ロードマップへの統合: RSPプロトコルは、製品および研究の要件として扱われます。RSPの期限に間に合わない場合、新しいモデルのトレーニングや製品の出荷が停止される可能性があります。
  • リソースの割り当て: Anthropicは、ASL-3の要件を満たすために、セキュリティ、信頼と安全、レッドチーミング、および解釈可能性の採用を強化しています。

説明責任とガバナンス

Anthropicは、多層的なガバナンス構造を通じてRSPの遵守を確保しています。

  • 取締役会の監督: RSPは取締役会の正式な指令です。
  • 外部監督: 取締役会は、会社に財務的な利害関係を持たない専門家の外部パネルである、Long Term Benefit Trustに対して説明責任を負います。
  • コンプライアンス・メカニズム: 同社は内部告発者ポリシーを導入しており、RSPの遵守およびLong Term Benefit Trustへの報告を担当する責任者を任命しています。

規制との関係

Anthropicは、RSPを政府規制の代わりではなく、将来の政府規制のプロトタイプとして捉えています。目標は、企業がこれらのフレームワークを精査し、政府がその最良の要素を採用して、標準化されたテスト、監査体制、および監督メカニズムを構築することです。Anthropicは、企業や国が安全性のフレームワークを向上させるために協力する「トップへの競争」を advocates します。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch