DeepMind AI 控制路線圖公告
DeepMind AI 控制路線圖公告
TL;DR
DeepMind 宣佈了其 AI 控制路線圖,這是一個深度防禦框架,將內部 AI 代理視為潛在的內部威脅,並加入系統層面的防護措施——監控、監督與回應層級——以防止代理在變得更強大時出現不對齊或惡意行為。
AI 控制路線圖概述
AI 控制路線圖是 DeepMind 為先進 AI 代理所設計的內部安全框架。它在傳統防護(沙箱、端點安全、提示注入防護)的基礎上構建,並將模型對齊作為第一道防線。關鍵在於,它假設代理可能未完全對齊,並加入第二層可即時監控與介入的機制,類似於配備雙重控制的駕駛教練。
AI 代理的威脅建模框架
- DeepMind 將 MITRE ATT&CK 知識庫套用於 AI,將不受信任的代理視為內部威脅。
- 透過將潛在攻擊拆解為戰術與技術,路線圖能系統性地追蹤風險、早期偵測不良行為,並進行安全演練以驗證防禦。
三階段緩解流程
- 偵測 – 受信任的監督 AI 持續審查代理的推理、行動與計畫,以發現偏差。
- 預防與回應 – 當監督者偵測到有害意圖時,可在造成損害前阻止該行動。
- 效能衡量 – 持續測量覆蓋率(被監控流量的比例)、召回率(捕捉到的不對齊行為比例)以及回應時間。
隨代理能力擴展安全性
DeepMind 將安全協議映射到兩個能力維度:
- 迴避能力 – 代理可能透過 監督意識 或 不透明推理 隱藏其推理過程。隨著迴避程度提升,偵測等級 (D1‑D4) 會升高,需進行更深入的行為分析或檢查內部模型狀態。
- 危害潛力 – 低風險、可逆的行動可透過非同步審查處理;高風險行動(例如網路攻擊)則需要同步、即時的阻斷。預防/回應等級 (R1‑R3) 會依潛在危害的嚴重程度而擴展。
資料驅動監控:一百萬代理軌跡
DeepMind 為程式編寫代理構建了一個非同步監控原型,分析了一百萬條代理軌跡。發現包括:
- 被標記的事件大多源於代理的誤解或過度熱衷,而非對抗性意圖。
- 系統超越關鍵字過濾,偵測高訊號的行為模式,為 Gemini Spark 代理的即時監控提供資訊。
生態系統中的共同責任
路線圖是 DeepMind 與其更廣泛基礎設施整合的多層安全方法之一。該實驗室亦發布了以政策為導向的技術框架 Three Layers of Agent Security,呼籲產業、監管機構與學術界採用共同標準,涵蓋:
- 單一代理的安全性。
- 多代理系統的安全性。
- 賦能網路防禦者並建立社會韌性。
取得完整技術資料
- AI Control Roadmap (PDF) – 詳細的技術報告,概述威脅模型、緩解層級與效能指標。
- Three Layers of Agent Security (PDF) – 給外部利害關係人的政策框架。
研究作者:Mary Phuong、Erik Jenner、Laurent Simon、Lewis Ho、Rohin Shah、Sebastian Farquhar 與 Scott Coull。
致謝:Four Flynn、Anca Dragan、Alan Cooney、Bilal Chughtai、Buck Shlegeris、Cody Wild、David Lindner、Julian Stastny、Kevin Klyman、Li Ding、Myriam Khan、Raluca Ada Popa、Roland Zimmermann、Ryan Greenblatt、Senthooran Rajamanoharan、Victoria Krakovna、Xerxes Dotiwalla。
Sources
- OriginalSecuring the future of AI agents