Anthropic、AI Safety Level 3 (ASL-3) 保護策を有効化

Anthropic、Claude Opus 4 のために ASL-3 保護策を有効化

Anthropic は、Claude Opus 4 のリリースに伴い、AI Safety Level 3 (ASL-3) のデプロイメントおよびセキュリティ基準を有効化しました。この措置は、モデルの能力向上に伴い、化学、生物、放射性、および核(CBRN)兵器に関する ASL-3 リスクを完全に排除できないため、予防的かつ暫定的に取られた行動です。

Responsible Scaling Policy (RSP) フレームワーク

Anthropic の AI Safety Level (ASL) 基準は、Responsible Scaling Policy (RSP) によって管理されており、モデルが特定の「Capability Thresholds」に達するにつれて、より高いレベルの保護を義務付けています。

  • Deployment Measures: これらは特定の誤用カテゴリを対象としており、主にモデルが CBRN 兵器の開発や取得を支援するリスクを軽減することに焦点を当てています。
  • Security Controls: これらは、AI の中核となる知能を表すモデルの重み(model weights)の盗難を防ぐように設計されています。

これまでのすべてのモデルは、ベースラインである AI Safety Level 2 (ASL-2) 基準の下でデプロイされてきましたが、Claude Opus 4 は ASL-3 の下でデプロイされる最初のモデルです。Anthropic は、Claude Opus 4 に対して ASL-4 基準の必要性は否定しており、また Claude Sonnet 4 は ASL-3 の保護を必要としないと判断しています。

ASL-3 Deployment Measures: CBRN の誤用防止

ASL-3 のデプロイメント対策は、大規模言語モデルなしでは不可能な、付加価値を提供するエンドツーエンドの CBRN ワークフローを Claude Opus 4 が支援することを防ぐことに狭く焦点を当てています。これらの対策は、特に「universal jailbreaks」—CBRN 関連の情報を長い連鎖として抽出するために使用される体系的な攻撃—を対象としています。

これを達成するために、Anthropic は3つの戦略を実装しています:

1. Jailbreaks に対するシステムの強化

Anthropic は、Constitutional Classifiers を使用しています。これは、有害な CBRN 関連のプロンプトと完了文の合成データを用いてトレーニングされた、リアルタイムのガードです。これらの分類器は、入出力内容を監視し、中程度の計算オーバーヘッドで有害な CBRN 情報のブロックを行います。

2. Jailbreak 検出

監視は、Constitutional Classifiers のストレス・テストに特化したバグ・バウンティ・プログラム、オフライン分類システム、および universal jailbreaks を迅速に特定するための脅威インテリジェンス・パートナーシップによって強化されています。

3. 反復的な防御の改善

Anthropic は、発見された攻撃を模倣した合成 jailbreaks を生成し、そのデータを使用して更新された分類器をトレーニングすることで、n/a、jailbreaks を修正します。

ASL-3 Security Controls: モデルの重みの保護

ASL-3 のセキュリティ・コントロールは、高度な非国家主体によるモデルの重みの盗難を試みる攻撃から防御するように設計されています。このフレームワークには、防止と検出を組み合わせた 100 種類以上の異なるセキュリティ・コントロールが含まれています。

主なセキュリティ対策には以下が含まれます:

  • Standard Best Practices: 重みのアクセスに対する二人体制の承認、強化された変更管理プロトコル、およびエンドポイント・ソフトウェアのバイナリ・ホワイトリスト化。
  • Egress Bandwidth Controls: セキュアなコンピューティング環境からのデータ流出を制限する特化型のコントロール。モデルの重みは非常に大規模であるため、アウトバウンドのネットワーク・トラフィックを制限することで、Anthropic は、データの持ち出し(exfiltration)の試みを示す可能性のある異常な帯域幅の使用を検知・ブロックすることが可能になります。

実装の根拠と今後の展望

Anthropic は、これらの防御策を義務化される前に、それらを洗練させるために、ASL-3 保護策を予防的に実装しました。同社は、危険な能力の評価は困難であり、モデルが懸念される閾値に近づくにつれて、その正確なステータスを判断するのに時間がかかることを指摘しています。

さらなる評価の結果、Claude Opus 4 が関連する Capability Thresholds を超えていないことが結論付けられた場合、Anthropic はこれらの ASL-3 保護策を調整または削除する可能性があります。同社は、これらの対策を継続的に反復させ、AI ガードリング手法を改善するために、業界パートナー、政府、および市民社会と協力していく意図があります。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch