AnthropicとNNSA、AI核セーフガード分類器を開発

Anthropicは、核兵器開発へのAIモデルの悪用を検出し、防止するために、米国エネルギー省(DOE)および国家核安全保障局(NNSA)と共同で、特化型のAI分類器を共同開発しました。このパートナーシップは、正当な科学的・教育的目的のためのモデルの有用性を維持しつつ、国家安全保障上の脅威に対してフロンティアAIモデルを保護するための、官民協力の枠組みを確立するものです。

核拡散リスクのためのAI分類器

AnthropicとNNSAは、懸念される核関連の会話と、無害な議論を区別するように設計された自動分類システムを構築しました。合成データを使用した予備テストでは、分類器は全体で96.2%の精度を達成し、核兵器に関するクエリの検出率は94.8%、誤検知はゼロでした。

開発プロセス

分類器は、レッドチーミングと検証の反復サイクルを通じて開発されました:

  1. リスク指標の特定: 安全な環境下でのClaudeモデルに対するNNSAによる1年間のレッドチーミングに続き、NNSAは厳選された核リスク指標のセットを提供しました。これらの指標は、AnthropicのPolicy and Safeguardsチームと共有可能な分類レベルで開発されました。
  2. 分類器の構築: Anthropicは、これらのリスク指標を、スパムフィルターと同様に機能するリアルタイムの分類器に変換し、会話を潜在的に有害、または無害のいずれかにラベル付けしました。
  3. 合成による検証: 国家安全保障機関と民間企業間の情報共有の制約を回避するため、チームは合成データの生成を使用しました。AnthropicはNNSAの例に基づいた数百のテストプロンプトを生成し、その後NNSAがそれらを検証して、分類器のスコアが期待されるラベルと一致することを確認しました。
  4. 洗練: システムは、NNSAからのフィードバックに基づき、テストと改善の繰り返しのサイクルを通じて洗練されました。

実社会での展開とパフォーマンス

分類器は現在、AnthropicのSafeguardsフレームワークへの実験的な追加機能として展開されており、Claudeのトラフィックの一部を監視しています。実社会のデータは、合成テスト環境を超えたツールの有効性を裏付けています。

グレーゾーンと文脈の処理

展開データにより、実社会の会話は合成データよりも複雑であることが明らかになりました。例えば、分類器は中東の時事問題に関する無害な会話を、時折、懸念すべきものとしてフラグを立てることがありました。Anthropicは、hierarchical summarization(階層的要約)を使用することで、これらの誤検知を軽減しました。これは、複数のフラグが立てられた会話をまとめてレビューし、それらが無害であることを特定するために必要な文脈を提供するためのプロセスです。

敵対的テストによる検証

分類器の有効性は、Anthropic自身のレッドチーマーが、分類器の展開を知らされていない状態で、日常的な敵対的テスト中に使用した懸念すべきプロンプトを、分類器が正常に成功裏に特定したことによって、さらに証明されました。

業界への影響と設計図

Anthropicは、そのアプローチをFrontier Model Forumと共有し、他のAI開発者が同様のセーフガードを実装することを奨励しています。政府の専門知識と業界の技術的能力を組み合わせることで、このパートナーシップは、さまざまな領域における重大な国家安全保障上のリスクに対処するための、自発的な官民協力の設計図として機能します。

Sources

関連