DeepMind AI 控制路线图公告
DeepMind AI 控制路线图公告
TL;DR
DeepMind 公布了其 AI 控制路线图,这是一套深度防御框架,将内部 AI 代理视为潜在的内部威胁,并添加系统级的安全措施——监控、监督和响应层,以在代理变得更强大时防止其出现不对齐或恶意行为。
AI 控制路线图概览
AI 控制路线图是 DeepMind 为高级 AI 代理制定的内部安全框架。它在传统安全措施(沙箱、端点安全、提示注入防御)的基础上,将模型对齐视为第一道防线。关键在于,它假设代理可能并未完全对齐,并增加第二层实时监控和干预,类似于配备双重控制的驾驶教练。
AI 代理的威胁建模框架
- DeepMind 将 MITRE ATT&CK 知识库迁移到 AI 场景,将不受信任的代理视为内部威胁。
- 通过将潜在攻击拆解为战术和技术,路线图实现了系统化的风险追踪、早期异常行为检测以及安全演练来验证防御措施。
三阶段缓解流程
- 检测 – 受信任的监督 AI 持续审查代理的推理、行动和计划,以发现偏离。
- 预防与响应 – 当监督者检测到有害意图时,可在造成损害之前阻止该行为。
- 性能衡量 – 持续测量覆盖率(监控流量的比例)、召回率(捕获的不对齐行为比例)以及响应时间。
随代理能力扩展的安全措施
DeepMind 将安全协议映射到两个能力维度:
- 规避能力 – 代理可能通过 监督感知 或 不透明推理 隐藏其思考过程。检测等级(D1‑D4)随规避程度提升而提升,需要更深入的行为分析或内部模型状态检查。
- 危害潜力 – 低风险、可逆的行为可采用异步审查;高风险行为(例如网络攻击)则需要同步、实时阻断。预防/响应等级(R1‑R3)随潜在危害的严重程度而扩展。
数据驱动监控:一百万条代理轨迹
DeepMind 为编码代理构建了异步监控原型,分析了一百万条代理轨迹。主要发现包括:
- 被标记的事件大多源于代理误解或过度积极,而非对抗性意图。
- 系统已超越关键词过滤,能够检测高信号的行为模式,为 Gemini Spark 代理的实时监控提供依据。
生态系统中的共享责任
该路线图是 DeepMind 与其更广泛基础设施相结合的多层安全方法的一部分。实验室还发布了面向政策的技术框架 Three Layers of Agent Security,呼吁行业、监管机构和学术界采用统一标准,涵盖:
- 单个代理的安全。
- 多代理系统的安全。
- 赋能网络防御者并构建社会韧性。
获取完整技术材料
- AI Control Roadmap (PDF) – 详细技术报告,阐述威胁模型、缓解层级和性能指标。
- Three Layers of Agent Security (PDF) – 面向外部利益相关者的政策框架。
研究作者:Mary Phuong, Erik Jenner, Laurent Simon, Lewis Ho, Rohin Shah, Sebastian Farquhar, and Scott Coull。
致谢:Four Flynn, Anca Dragan, Alan Cooney, Bilal Chughtai, Buck Shlegeris, Cody Wild, David Lindner, Julian Stastny, Kevin Klyman, Li Ding, Myriam Khan, Raluca Ada Popa, Roland Zimmermann, Ryan Greenblatt, Senthooran Rajamanoharan, Victoria Krakovna, Xerxes Dotiwalla。
Sources
- OriginalSecuring the future of AI agents