Google DeepMind 前沿安全框架更新

Google DeepMind 已將其前沿安全框架(Frontier Safety Framework,簡稱 FSF)更新至第三版,擴大了風險領域並精緻了評估流程,以減輕先進 AI 模型可能帶來的嚴重風險。此更新聚焦於將有害操控的偵測落實於營運中,並處理與 AI 驅動的研發相關的不對齊風險。

有害操控的全新關鍵能力層級

Google DeepMind 為有害操控引入了全新的關鍵能力層級(Critical Capability Level,簡稱 CCL)。當 AI 模型具備可被濫用以系統性且大幅改變高風險情境下信念與行為的操控能力時,該 CCL 會被觸發,可能導致大規模嚴重傷害。此新增項目基於對生成式 AI 中操控機制的研究。

應對不對齊與 AI 研究風險

更新後的框架擴大範圍,以處理不對齊的 AI 模型可能干擾操作員指揮、修改或關閉作業的情境。

關鍵變更包括:

  • Shift from Instrumental Reasoning: 框架從以工具性推理 CCL(針對欺騙性思考的警示層級)為中心的探索性方法,轉向聚焦於可能將 AI 研發推向不穩定層面的模型之協議。
  • Risk Integration: 框架現在納入因模型可能的無指向行動以及這些模型在部署流程中的整合所產生的不對齊風險。
  • Expanded Safety Case Reviews: 安全案例審查——展示風險已降至可管理水平的詳細分析——不僅在外部發布時必須執行,亦在達到先進機器學習研發 CCL 時,於大規模內部部署時同樣需要。

精緻化風險評估與治理

Google DeepMind 已細化其關鍵能力層級(CCL)定義,以更好地識別需要最嚴格治理的關鍵威脅。雖然在模型開發全程皆會套用標準的安全與安全性緩解措施,CCL 仍作為觸發更高階緩解策略的警訊。

風險評估流程現在包括:

  • 系統性風險識別。
  • 模型能力的全面分析。
  • 風險可接受性的明確判定。

引入可追蹤能力層級(FSF 3.1)

自 2026 年 4 月 17 日起,Google DeepMind 在特定領域引入了可追蹤能力層級(Tracked Capability Levels,簡稱 TCL)。TCL 的設計目的是識別與評估相較於 CCL 所定義之風險較不嚴重的潛在風險,讓實驗室能在開發週期中更早發現並緩解風險。

致力於循證安全

前沿安全框架的設計旨在根據利益相關者的意見、新研究與實施經驗持續演進。Google DeepMind 表示,該框架的目標是在能力邁向通用人工智慧(Artificial General Intelligence,AGI)之際,確保轉型 AI 的利益得以實現,同時將傷害降至最低。

Sources