DeepMind 试点全球首个双盲 AI 评估

TL;DR

DeepMind 对其专有的 Gemini Flash Lite 模型进行了全球首次双盲评估,利用 Google Cloud Confidential Computing 确保模型权重和评估提示词对对方均不可见,从而消除了基准测试污染并增强了对 AI 性能指标的信任。

什么是双盲评估及其重要性

双盲评估保证了模型提供商无法看到测试提示词,而评估者也无法看到模型权重。这消除了历史上的权衡问题,即外部测试人员要么向模型所有者泄露其基准测试数据,要么接收模型的权重,从而面临知识产权泄露的风险。通过在安全飞地(secure enclave)中对这两项资产进行加密密封,评估能够反映模型的真实能力,而无需事先接触测试材料。

试点的技术架构

该试点使用了 Google Cloud Confidential Computing 产品组合中的 Confidential Space。工作流程遵循七个步骤:

  1. 外部评估者将机密基准测试数据上传到 GPU enclave
  2. DeepMind 将专有的 Gemini Flash Lite 模型上传到同一个飞地中。
  3. 飞地通过远程度量(attestation)验证数据和模型对各自所有者保持加密状态。
  4. 模型在飞地内部对隐藏的提示词进行推理。
  5. 结果记录在防篡改账本中。
  6. 双方都收到加密证明,证明对方的资产从未被泄露。
  7. 最终得分向公众发布,而不泄露任何底层数据。

"By using Confidential Space we can cryptographically verify that both the external evaluation data and the proprietary model remain private to their respective owners." – DeepMind blog

合作伙伴与试点范围

DeepMind 与 Singapore AI Safety InstituteOpenMinedAVERIMLCommons 合作。该试点针对 Gemini Flash Lite 模型测试了一套机密基准测试,这些基准测试代表了网络安全和政府级评估等高风险用场景。

对 AI 生态系统的益处

  • 防止基准测试污染:模型无法在评估前“偷看”测试提示词,从而消除了人为的分数膨胀。
  • 保护知识产权:模型所有者对权重和架构保持完全的秘密性。
  • 实现可信的第三方测试:独立实验室可以严格评估先进模型,而无需承担数据泄露的风险。
  • 支持政策和监管信心:决策者可以确信发布的基准测试结果未受损害,从而促进更明智的监管。

对未来模型监管的影响

如果被广泛采用,双盲评估可能会成为高影响力 AI 测试的事实标准,特别是在部署于安全关键型或受监管领域的模型。由飞地生成的加密证据提供了可验证的审计追踪,这可能成为合规框架或行业标准的要求。

在哪里查找更多详情

DeepMind 发布了一份完整的技术报告,描述了方法论、加密保证和试点结果。报告可在以下网址获取: https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/piloting-the-worlds-first-double-blind-ai-evaluations/double-blind-evaluations-technical-report.pdf

展望

该试点旨在展示一个可扩展的、保护隐私的评估流程,其他 AI 开发商和基准测试组织可以复制该流程。通过建立一个可信的双盲测试机制,行业正朝着更可靠、透明且安全的 AI 性能报告迈进。


本文基于 DeepMind 于 2026 年 8 月 27 日发布的官方博客文章。

Sources

相关