AnthropicによるAIセーフガードのための米国CAISIおよび英国AISIとの連携
Anthropicは、AIモデルの脆弱性を特定し軽減するために、米国AI標準・イノベーションセンター(CAISI)および英国AIセキュリティ研究所(AISI)との継続的なパートナーシップを確立しました。この連携は、国家安全保障、サイバーセキュリティ、および脅威モデリングにおける政府の専門知識を活用し、高度な悪用に対するAIセーフガードの堅牢性を向上させることを目的としています。
レッドチーミングを通じた憲法分類器(Constitutional Classifiers)の強化
Anthropicは、Claude Opus 4および4.1を含むモデルの展開前に、ジェイルブレイク(脱獄)を検知・防止するために使用される防御システムである「憲法分類器(Constitutional Classifiers)」の複数の反復的な評価を行うために、CAISIおよびAISIを活用しました。この反復的なストレス・テスト・プロセスにより、いくつかの重要な脆弱性クラスが明らかになりました。
- Prompt Injection: 政府のレッドチーマーは、人間によるレビューが行われたと偽って主張するなどの特定の注釈が、分類器の検知を回避できる弱点があることを特定しました。
- Universal Jailbreaks: テスターは、標準的な検知を回避するために有害なやり取りをエンコードした、高度なジェイルブレイクを開発しました。これにより、Anthropicは単なるパッチの適用ではなく、セーフガード・アーキテクチャを根本的に再構築することになりました。
- Cipher-based Attacks: 暗号、文字置換、およびその他の難読化技術が分類器の回避に使用されました。これにより、エンコーディングに関わらず、偽装されたコンテンツを認識できるように検知システムの改善が行われました。
- Input and Output Obfuscation: テスターは、有害な文字列をより大きな文脈の中で無害なコンポーネントに断片化させる、ユニバーサルなジェイルブレイクを発見しました。その結果、フィルタリング・メカニズムの標的を絞った改善が行われました。
- Automated Attack Refinement: パートナーは、攻撃戦略を段階的に最適化する自動化システムを開発し、効果的なユニバーサル・ジェイルブレイクを生成しました。Anthropicは現在、これらをセーフガードの向上に利用しています。
リスク・メソドロジーと評価の強化
特定の技術的な脆弱性だけでなく、CAISIおよびAISIとの連携は、Anthropicのより広範なセキュリティ・アプローチを向上させました。政府機関は、展開モニタリング、迅速な対応能力、およびエビデンス要件に関する外部の視点を提供し、それがAnthropicの内部脅威モデルのプレッシャー・テスト(負荷試験)を助け、より多くのエビデンスが必要な領域を特定するのに役立ちました。
効果的な政府・産業界の連携フレームワーク
Anthropicは、政府の研究機関および標準化団体とのこのパートナーシップの有効性を可能にした、いくつかの主要な要因を特定しています。
包括的なシステム・アクセス
システムへの深いアクセスを提供することで、より高度な脆弱性発見が可能になります。Anthropicは、政府のレッドチーマーに対して以下のリソースを提供しました。
- Pre-deployment Prototypes: セーフガードのプロトタイプへのアクセスにより、システムが稼働する前に弱点を特定することができました。
- Diverse System Configurations: テスターは、完全に保護されていないベース・モデルから、完全なセーフガードを備えたモデルまで、多様なシステム構成にアクセスできました。これにより、攻撃を段階的に洗練させることが可能になりました。
- Internal Documentation: セーフガード・アーキテクチャ、文書化された脆弱性、および詳細なコンテンツ・ポリシー情報に関する透明性が、テスターが価値の高い領域を標的にすることを助けました。
- Real-time Data: 分類器のスコアへの直接的なアクセスにより、テスターは攻撃戦略を精緻化し、標的を絞った探索的研究を行いました。
反復的かつ継続的な関与
継続的な連携は、日々のコミュニケーションや頻繁な技術的なディープ・ダイブ(詳細解析)を含むため、外部チームが、単一の評価では見つけられない複雑な脆弱性を明らかにするために必要な、深いシステム・エキスペリセンス(専門知識)を開発することを可能にします。
多層防御戦略
Anthropicは、専門的な政府による評価と、公開バグ・バウンティ・プログラムのような他のセキュリティ対策を組み合わせています。バグ・バウンティは、幅広い才能ある層から多様なレポートを大量に提供しますが、政府チームは、微細で複雑な攻撃ベクトルを回避するための深い技術的知識を提供します。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch