AnthropicとNNSA、AI核安全保障分類器を開発

Anthropicは、米国エネルギー省(DOE)および国家核安全保障局(NNSA)と提携し、核兵器開発のためのAIモデルの悪用を検出し、防止するために設計された特化型のAI分類器を開発しました。このコラボレーションは、フロンティアAIモデルにおける核拡散リスクを評価および監視するための官民パートナーシップモデルを確立するものです。

核拡散リスクの監視

Anthropicは、NNSAおよびDOEの国立研究所と共同で、核に関連する会話を自動的に分類するAI分類器を共同開発しました。このシステムは、無害な核に関する議論と、懸念される核拡散リスクを示す議論を区別するように設計されています。

予備テストにおいて、この分類器は96%の精度を達成しました。このツールは、モデルの悪用を特定するためのより広範なシステムの一環として、Claudeのトラフィックに導入されています。

官民パートナーシップの枠組み

核のリスクを評価することは、評価に必要な情報が非常に機密性が高いため、民間企業にとって困難な課題です。これに対処するため、Anthropicは2024年4月にNNSAと提携し、拡散リスクに関するモデルの評価を行いました。

このパートナーシップは、核セキュリティにおける政府の専門知識と、AI開発における業界の能力という、互いに補完的な強みを組み合わせています。Anthropicは、そのアプローチをFrontier Model Forumと共有し、他のAI開発者がNNSAと連携して同様の安全策を導入するための設計図を提供することを意図しています。

国家安全保障への影響

核技術はデュアルユース(二重用途)であり、発電と兵器開発の両方に同じ物理学の原理が適用されるため、フロンティアAIモデルは、国家安全保障を脅かす可能性のある危険な技術的知識をユーザーに提供しないよう監視されなければなりません。この取り組みは、重大なセキュリティリスクに正面から取り組むことで、AIモデルをより信頼性が高く、信頼できるものにするための、より広範な戦略の一部です。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch