Google DeepMind 多智能體 AI 安全研究資助計畫
Google DeepMind 多智能體 AI 安全研究資助計畫
Google DeepMind 與 Schmidt Sciences、Cooperative AI Foundation、ARIA 及 Google.org 合作,推出最高達 1,000 萬美元的技術研究資助計畫,以研究多智能體 AI 系統的安全性。此舉旨在建立框架,以理解並緩解當數百萬來自不同組織的獨立 AI 代理在數位環境中互動、協商及交易時產生的「看不見」的安全風險。
多智能體生態系統中的新興風險
多智能體 AI 安全與傳統 AI 安全不同,因為它關注集體行為而非個別模型性能。儘管目前多數安全評估是在隔離環境中分析模型,但自主代理的互動可能產生複雜的「新興」行為,這些行為難以預測和衡量。
Google DeepMind 識別出與這些互動相關的幾種潛在系統級風險,包括:
- 不可預測的經濟活動: 代理互動可能導致突發、波動的經濟交易激增。
- 安全挑戰: 集體代理行為導致新漏洞或威脅的出現。
- 監控工具不足: 目前缺乏預測、測量和監控集體能力變化所需的工具。
多智能體安全的研究優先領域
為應對多智能體互動的複雜性,該資助計畫邀請在四個特定優先領域提交提案:
沙盒與測試環境
鼓勵研究者建立真實且可重現的環境——例如模擬生態系統、虛擬市場和跨組織工作流程——以評估和比較多智能體安全的進展。
代理網絡科學
此領域專注於理解互動代理群體與安全相關的屬性。主要目標包括調查集體能力如何產生和擴展,識別網絡如何變得不穩定或失效,以及開發方法來偵測危險的群體層級屬性。
加強代理基礎設施
需要研究對身份、聲譽和承諾協議進行壓力測試,以確保跨平台代理互動的安全。
監管與控制
此優先領域專注於開發方法來監控已部署的代理群體,並在規模上緩解集體危害。
背景與合作框架
此舉建立在先前研究之上,包括 Google DeepMind 2025 年關於理解代理互動的框架以及有關對抗環境中漏洞的「AI 代理陷阱」研究。它與 Schmidt Sciences 的可信 AI 與 AI 代理計畫的 Science of Trustworthy AI 使命相一致,亦與 ARIA 的 Scaling Trust 計畫相一致,該計畫專注於網絡物理多智能體協調。
由於多智能體互動的複雜性正超越現有的安全模型,組織者強調,單一實驗室無法獨自解決這些挑戰,需要建立一個全球獨立研究者網絡,以確保透明且穩健的安全標準。
SUMMARY: Google DeepMind 與其合作夥伴宣布了一項 1,000 萬美元的資助計畫,以研究大規模多智能體 AI 系統的安全與穩定性,以緩解由互動的獨立代理產生的新興風險。
TITLE: Google DeepMind 多智能體 AI 安全研究資助計畫