Google DeepMind 前沿安全框架更新
Google DeepMind 已将其前沿安全框架(FSF)更新至第三版,扩展了风险领域并细化了评估流程,以降低先进 AI 模型带来的严重风险。本次更新侧重于将有害操纵的检测落地,并应对与 AI 驱动的研发相关的错位风险。
有害操纵的新关键能力层级
Google DeepMind 引入了专门针对有害操纵的关键能力层级(CCL)。当 AI 模型具备可被滥用以系统性、显著地改变高风险情境下的信念和行为的操纵能力时,将触发该 CCL,可能导致大规模严重伤害。此项新增基于对生成式 AI 中操纵机制的研究。
解决错位与 AI 研究风险
更新后的框架扩大了适用范围,以应对错位 AI 模型可能干扰操作者指挥、修改或关闭操作的情形。
针对错位的处理方法的关键变化包括:
- 从工具理性转变: 框架不再采用以工具理性 CCL(用于欺骗性思维的警示层级)为中心的探索性方法,而是转向针对可能将 AI 研究与开发加速至不稳定水平的模型的协议。
- 风险整合: 框架现在考虑因模型潜在的无指向行为以及这些模型在部署过程中的整合而产生的错位风险。
- 扩展安全案例审查: 安全案例审查——展示风险已降至可管理水平的详细分析——现在不仅在外部发布时需要,在达到先进机器学习研发 CCL 时的大规模内部部署也必须进行审查。
精细化风险评估与治理
Google DeepMind 已细化其关键能力层级(CCL)的定义,以更好地识别需要最严格治理的关键威胁。虽然在模型开发全过程中都会采用标准的安全与安保措施,但 CCL 充当触发更高强度缓解策略的信号。
风险评估流程现包括:
- 系统化风险识别。
- 模型能力的全面分析。
- 对风险可接受性的明确判定。
引入可追踪能力层级(FSF 3.1)
自 2026 年 4 月 17 日起,Google DeepMind 在特定领域引入了可追踪能力层级(TCL)。TCL 旨在识别和评估相较于 CCL 定义的风险程度较低的潜在风险,使实验室能够在开发周期的更早阶段发现并缓解风险。
致力于基于证据的安全
前沿安全框架旨在根据利益相关者的反馈、新研究以及实施经验不断演进。Google DeepMind 表示,该框架的目标是在能力向通用人工智能(AGI)迈进的过程中,实现变革性 AI 的收益,同时将危害降至最低。