Google DeepMind 多智能体 AI 安全研究资助呼吁

Google DeepMind 多智能体 AI 安全研究资助呼吁

Google DeepMind 与 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 合作,启动了一项最高可达 $10 million 的技术研究资助呼吁,以研究多智能体 AI 系统的安全性。此举旨在建立框架,以理解和减轻当数百万来自不同组织的独立 AI 智能体在数字环境中相互作用、谈判和交易时出现的“不可见”安全风险。

多智能体生态系统中的新兴风险

多智能体 AI 安全与传统 AI 安全不同,因为它关注的是集体行为而非单个模型的性能。目前大多数安全评估是在隔离状态下分析模型,而自治智能体的相互作用可能产生难以预见和测量的复杂“涌现”行为。

  • 不可预测的经济活动: 智能体互动可能导致突发、波动的经济交易激增的可能性。
  • 安全挑战: 集体智能体行为导致的新漏洞或威胁的出现。
  • 缺乏监控工具: 目前缺乏用于预测、测量和监控集体能力转变所需的工具。

多智能体安全的研究优先事项

为了应对多智能体交互的复杂性,该资助呼吁邀请在四个具体优先领域提交提案:

沙盒和测试床

鼓励研究者构建真实且可重复的环境——例如模拟生态系统、虚拟市场和多组织工作流——以评估和比较多智能体安全的进展。

智能体网络科学

此领域侧重于理解交互智能体群体的与安全相关的属性。主要目标包括研究集体能力如何涌现和规模化,识别,识别网络如何变得易变或失效,以及开发检测危险群体级属性的方法。

加强智能体基础设施

需要进行研究,以压力测试保障跨平台智能体交互的身份、声誉和承诺协议。

监督与控制

此优先领域侧重于开发方法来监督已部署的智能体群体,并在规模上减轻集体危害。

背景与协作框架

此举建立在之前的研究之上,包括 Google DeepMind 2025 年关于理解智能体交互的框架以及关于对抗环境中漏洞的 "AI Agent Traps" 工作。它与 Schmidt Sciences 的可信 AI 和 AI 智能体计划的使命相一致,也与 ARIA 的 Scaling Trust 计划相一致,后者专注于网络物理多智能体协调。

由于多智能体交互的复杂性正在超越现有的安全模型,组织者强调,单个实验室无法独自解决这些挑战,需要构建一个全球独立研究者网络,以确保透明且健壮的安全标准。

Sources