DeepMind AI コントロールロードマップ 発表

DeepMind AI コントロールロードマップ 発表

TL;DR

DeepMindはAIコントロールロードマップを発表しました。これは防御層を重ねたフレームワークで、内部のAIエージェントを潜在的な内部脅威とみなし、システムレベルの安全策(モニタリング、監督、応答層)を追加し、エージェントがより高度になるにつれて、ミスアラインや悪意ある行動から保護します。

AIコントロールロードマップの概要

AIコントロールロードマップは、DeepMindが高度なAIエージェント向けに内部で使用しているセキュリティフレームワークです。従来の安全策(サンドボックス、エンドポイントセキュリティ、プロンプトインジェクション耐性)を基盤にし、モデルアラインメントを第一の防御線と位置付けます。重要なのは、エージェントが完全にアラインされていない可能性を前提とし、リアルタイムで監視・介入できる第二層を追加する点で、まるでデュアルコントロールを備えた運転指導員のような役割を果たします。

AIエージェント向け脅威モデリングフレームワーク

  • DeepMindはMITRE ATT&CKナレッジベースをAI向けに適用し、信頼できないエージェントを内部脅威として扱います。
  • 攻撃を戦術と技術に分解することで、ロードマップは体系的なリスク追跡、悪質な行動の早期検出、そして防御策の検証を行う安全演習を可能にします。

3段階の緩和プロセス

  1. Detection – 信頼された監督AIがエージェントの推論、行動、計画を継続的にレビューし、逸脱を検出します。
  2. Prevention and Response – 監督者が有害な意図を検知した場合、被害が発生する前にその行動をブロックできます。
  3. Performance Measurement – カバレッジ(監視されたトラフィックの割合)、リコール(検出されたミスアライン行動の割合)、応答時間を継続的に測定します。

エージェント能力に応じたセキュリティのスケーリング

DeepMindはセキュリティプロトコルを以下の2つの能力次元にマッピングしています:

  • Evasion Ability – エージェントは oversight awareness(監視認識)や opaque reasoning(不透明な推論)を通じて推論を隠すことがあります。回避能力が高まるにつれて検出レベル(D1‑D4)が上がり、より深い行動分析や内部モデル状態の検査が必要になります。
  • Harm Potential – 低リスクで可逆的な行動は非同期レビューで処理できますが、高リスクな行動(例:サイバー攻撃)は同期的・リアルタイムのブロッキングが求められます。予防/応答レベル(R1‑R3)は潜在的被害の深刻度に応じてスケールします。

データ駆動型モニタリング:100万件のエージェント軌跡

DeepMindはコーディングエージェント向けに非同期モニタリングのプロトタイプを構築し、100万件のエージェント軌跡を分析しました。主な所見は次のとおりです:

  • フラグ付けされたイベントの大半は、エージェントの誤解や過剰な熱意によるもので、敵対的意図によるものではありません。
  • システムはキーワードフィルタを超えて、高シグナルな行動パターンを検出し、Gemini Spark エージェントのライブモニタに情報を提供します。

エコシステム全体での共有責任

このロードマップは、DeepMindが自社の広範なインフラと統合した多層的セキュリティアプローチの一部です。ラボはまた、ポリシー指向の技術フレームワーク Three Layers of Agent Security を公開し、産業界、規制当局、学術界に対し、以下の共通標準の採用を呼びかけています:

  • 個別エージェントのセキュリティ。
  • マルチエージェントシステムにおけるセキュリティ。
  • サイバー防御者の支援と社会的レジリエンスの構築。

完全な技術資料へのアクセス

  • AI Control Roadmap (PDF) – 脅威モデル、緩和層、パフォーマンス指標を詳細に示す技術報告書。
  • Three Layers of Agent Security (PDF) – 外部ステークホルダー向けのポリシーフレームワーク。

Research authors: Mary Phuong, Erik Jenner, Laurent Simon, Lewis Ho, Rohin Shah, Sebastian Farquhar, and Scott Coull.

Acknowledgements: Four Flynn, Anca Dragan, Alan Cooney, Bilal Chughtai, Buck Shlegeris, Cody Wild, David Lindner, Julian Stastny, Kevin Klyman, Li Ding, Myriam Khan, Raluca Ada Popa, Roland Zimmermann, Ryan Greenblatt, Senthooran Rajamanoharan, Victoria Krakovna, Xerxes Dotiwalla.

Sources