Anthropic 責任スケーリング・ポリシーの更新

Anthropicは、フロンティアAIシステムによる壊滅的なリスクを軽減するために設計されたリスクガバナンス・フレームワークである、責任スケーリング・ポリシー(RSP)を更新しました。今回の更新では、リスクの評価と管理に対してより柔軟なアプローチを導入し、開発中のモデルの能力に応じて、安全性とセキュリティの保護策が比例してスケールするようにしています。

比例的な保護策とAI安全性レベル(ASL)

Anthropicは、段階的なセキュリティおよび安全性対策のセットであるAI安全性レベル(ASL)基準を採用しています。これらの基準は、生物学的研究で使用されるバイオセーフティレベルと同様に、モデルの能力が向上するにつれて厳格さが増していきます。

現在、すべてのAnthropicモデルは、業界のベストプラクティスを反映していると同社が述べているASL-2基準の下で運用されています。更新されたポリシーでは、より高いASL基準への移行をトリガーする2つの主要な能力閾値(Capability Thresholds)を定義しています。

  • 自律的なAI研究開発: モデルが、通常は人間の専門知識を必要とする複雑なAI研究タスクを独立して実行できる場合、Anthropicは、より高いセキュリティ基準(潜在的にASL-4以上)と追加の安全性保証を要求します。
  • 化学、生物、放射性、および核(CBRN)兵器: モデルが、基本的な技術的背景を持つ個人がCBRN兵器の作成や配備を行うのを意味のある形で支援できる場合、同社は、強化されたセキュリティと配備コントロールを含むASL-3基準を要求します。

ASL-3 保護策と配備コントロール

モデルがASL-3の閾値に達した場合、Anthropicは悪用を防ぐために多層的なアプローチを実装します。セキュリティ対策には、モデルの重み(weights)のより強固な保護と、より厳格な内部アクセス制御が含まれます。配備の保護策には、以下が含まれます。

  • リアルタイムおよび非同期のモニタリング。
  • 迅速なレスポンス・プロトコル。
  • 迅速な配備前レッドチーミング。

実装、監督、およびガバナンス

RSPを効果的に実行するために、Anthropicはいくつかの運用プロセスを確立しています。

  • 能力評価(Capability Assessments): 定義された能力閾値に基づき、現在の保護策が適切であり続けるかを確認するための定期的な評価。
  • 保護策評価(Safeguard Assessments): セキュリティおよび配備の安全性対策が、要求されるASL基準を満たしていることを検証するための定期的な評価。
  • ドキュメンテーション(Documentation): 高信頼性産業で一般的なセーフティケース手法を用い、評価と意思決定を文書化すること。
  • 内部および外部レビュー: このフレームワークは、内部のストレス・テスト、安全性に関する問題の内部報告プロセス、および外部の専門家からのフィードバックの要請によって支えられています。

初期実装における教訓

オリジナルのRSPを1年間実施した結果、Anthropicは、評価の完了が予定より3日遅れたことや、プレースホルダー評価に関する不明確さなど、いくつかの手順上の不備を定めた。同社は、これらの事例がもたらすリスクは最小限であると結論付けましたが、これらはポリシーの柔軟性を高め、コンプライアンスの追跡を改善する必要性を浮き彫りにしました。

組織変更とリーダーシップ

Anthropicは、RSPのスケーリングを管理するために、リーダーシップの役割を役割を更新しました。

  • 責任スケーリング責任者(Responsible Scaling Officer): 共同創設者兼チーフ・サイエンス・オフィサーのJared Kaplanが、Sam McCandlishの後任としてこの役割を担います。
  • Head of Responsible Scaling: Anthropicは、RSPのコンプライアンスと反復を担うチームを調整するための、Head of Responsible Scalingという新しい役職を設けます。

Frontier Red Team、Trust & Safety、Security and Compliance、Alignment Science、および専用のRSP Teamを含む、いくつかの内部チームが、継続的なリスク管理プロセスに貢献しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch