Google DeepMind 与英国 AI 安全研究所扩大合作伙伴关系

Google DeepMind 与英国 AI 安全研究所 (AISI) 已签署新的谅解备忘录,将其合作范围从模型测试扩展到基础安全与安全性研究。该合作伙伴关系旨在为政府、工业界和社会提供对先进 AI 风险及其相应缓解措施的科学理解。

基础研究合作

Google DeepMind 正在扩大与英国 AISI 的合作,以超越对高性能模型的初步测试。扩大后的合作伙伴关系包括以下技术和运营承诺:

  • 专有访问: 分享专有模型、数据和想法,以加速研究进展。
  • 联合出版物: 制作联合报告和出版物,与更广泛的研究界分享研究结果。
  • 协作研究: 结合团队专业知识,进行更深入的安全与安全性研究。
  • 技术对话: 进行技术讨论,以应对复杂的安全性挑战。

关键技术研究领域

联合研究工作集中在安全性领域的三个关键领域:

监测 AI 推理过程

研究人员将开发监测 AI 系统“思考”或思维链 (CoT) 的技术。这项工作建立在 Google DeepMind 先前的研究以及与 AISI、OpenAI 和 Anthropic 的合作基础之上。CoT 监测旨在通过提供对 AI 系统如何产生答案的更深层理解,来补充可解释性研究。

理解社会与情感影响

该合作伙伴关系将调查“社会情感失调”的伦理影响,即 AI 模型即使在正确遵循指令的情况下,其行为也可能与人类福祉不一致。这项研究建立在 Google DeepMind 已有的工作基础之上,这些工作已帮助定义了 AI 安全性的这一领域。

评估经济系统

Google DeepMind 和 AISI 将通过在各种环境中模拟现实世界的任务,探索 AI 对经济系统的潜在影响。这些任务将由专家进行验证和评分,并按复杂性和代表性进行分类,以帮助预测长期的劳动力市场影响。

综合安全战略

与英国 AISI 的这一合作伙伴关系是更广泛安全战略的一部分,该战略包括前瞻性研究、与能力开发相结合的安全训练,以及用于缓解风险的工具和框架的开发。

Google DeepMind 通过其责任与安全委员会 (Responsibility and Safety Council) 利用内部治理来监测新兴风险,并实施技术和政策缓解措施。此外,该公司还与 Apollo Research、Vaultis 和 Dreadnode 等外部专家合作,对模型进行测试和评估,其中包括被描述为迄今为止最智能、最安全的模型 Gemini 3。

Sources