DeepMind 试点全球首个双盲 AI 评估
TL;DR
DeepMind 对其专有的 Gemini Flash Lite 模型进行了全球首次双盲评估,利用 Google Cloud Confidential Computing 确保模型权重和评估提示词对对方均不可见,从而消除了基准测试污染并增强了对 AI 性能指标的信任。
什么是双盲评估及其重要性
双盲评估保证了模型提供商无法看到测试提示词,而评估者也无法看到模型权重。这消除了历史上的权衡问题,即外部测试人员要么向模型所有者泄露其基准测试数据,要么接收模型的权重,从而面临知识产权泄露的风险。通过在安全飞地(secure enclave)中对这两项资产进行加密密封,评估能够反映模型的真实能力,而无需事先接触测试材料。
试点的技术架构
该试点使用了 Google Cloud Confidential Computing 产品组合中的 Confidential Space。工作流程遵循七个步骤:
- 外部评估者将机密基准测试数据上传到 GPU enclave。
- DeepMind 将专有的 Gemini Flash Lite 模型上传到同一个飞地中。
- 飞地通过远程度量(attestation)验证数据和模型对各自所有者保持加密状态。
- 模型在飞地内部对隐藏的提示词进行推理。
- 结果记录在防篡改账本中。
- 双方都收到加密证明,证明对方的资产从未被泄露。
- 最终得分向公众发布,而不泄露任何底层数据。
"By using Confidential Space we can cryptographically verify that both the external evaluation data and the proprietary model remain private to their respective owners." – DeepMind blog
合作伙伴与试点范围
DeepMind 与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作。该试点针对 Gemini Flash Lite 模型测试了一套机密基准测试,这些基准测试代表了网络安全和政府级评估等高风险用场景。
对 AI 生态系统的益处
- 防止基准测试污染:模型无法在评估前“偷看”测试提示词,从而消除了人为的分数膨胀。
- 保护知识产权:模型所有者对权重和架构保持完全的秘密性。
- 实现可信的第三方测试:独立实验室可以严格评估先进模型,而无需承担数据泄露的风险。
- 支持政策和监管信心:决策者可以确信发布的基准测试结果未受损害,从而促进更明智的监管。
对未来模型监管的影响
如果被广泛采用,双盲评估可能会成为高影响力 AI 测试的事实标准,特别是在部署于安全关键型或受监管领域的模型。由飞地生成的加密证据提供了可验证的审计追踪,这可能成为合规框架或行业标准的要求。
在哪里查找更多详情
DeepMind 发布了一份完整的技术报告,描述了方法论、加密保证和试点结果。报告可在以下网址获取: https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/piloting-the-worlds-first-double-blind-ai-evaluations/double-blind-evaluations-technical-report.pdf
展望
该试点旨在展示一个可扩展的、保护隐私的评估流程,其他 AI 开发商和基准测试组织可以复制该流程。通过建立一个可信的双盲测试机制,行业正朝着更可靠、透明且安全的 AI 性能报告迈进。
本文基于 DeepMind 于 2026 年 8 月 27 日发布的官方博客文章。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch