DeepMind 試行全球首個雙盲 AI 評估

TL;DR

DeepMind 啟動了全球首個針對專有 Gemini Flash Lite 模型進行的雙盲評估,利用 Google Cloud Confidential Computing 來確保模型權重與評估提示詞(prompts)對對方均不可見,從而消除基準測試污染並提升對 AI 性能指標的信任。

什麼是雙盲評估及其重要性

雙盲評估保證了模型提供者無法看到測試提示詞,而評估者也無法看到模型權重。這消除了歷史上的權衡問題,即外部測試人員要麼必須向模型所有者公開其基準測試數據,要麼必須接收模型的權重,從而面臨知識產權洩漏的風險。透過將兩者在安全隔離區(secure enclave)中進行加密封裝,評估結果能反映模型的真實能力,而不會在測試前有任何預先接觸測試材料的情況。

試行計畫的技術架構

此試行計畫使用了 Google Cloud Confidential Computing 系列中的 Confidential Space。工作流程遵循七個步驟:

  1. 外部評估者將機密基準測試數據上傳至 GPU enclave
  2. DeepMind 將專有的 Gemini Flash Lite 模型上傳至同一個 enclave。
  3. Enclave 透過證明(attestation)驗證數據與模型對其所有者仍保持加密狀態。
  4. 模型在 enclave 內部的隱藏提示詞上進行推理(inference)。
  5. 結果記錄在防篡改的帳本中。
  6. 雙方皆收到加密證明,確保對方的資產從未被洩露。
  7. 最終分數向公眾發布,且不洩露任何底層數據。

"By using Confidential Space we can cryptographically verify that both the external evaluation data and the proprietary model remain private to their respective owners." – DeepMind blog

合作夥伴與試行範圍

DeepMind 與 Singapore AI Safety InstituteOpenMinedAVERI、以及 MLCommons 合作。此次試行測試了 Gemini Flash Lite 模型,對應一系列代表高風險使用場景(如網絡安全與政府級評估)的機密基準測試。

對 AI 生態系統的好處

  • 防止基準測試污染:模型無法在評估前「偷看」測試提示詞,從除了人工分數膨脹的情況。
  • 保護知識產權:模型所有者對權重與架構保有完全的秘密性。
  • 實現值得信賴的第三方測試:獨立實驗室可以嚴格評估先進模型,而無需擔心數據洩漏風險。
  • 支持政策與監管信心:決策者可以確信發布的基準測試結果未受損害,從便於進行更明智的監管。

對未來模型監督的影響

如果被廣泛採用,雙盲評估可能成為高影響力 AI 測試的業界標準,特別是部署在安全關鍵或受監管領域的模型。由 enclave 產生的加密證據提供了可驗證的審計追蹤,這可能是合規框架或行業標準所要求的。

更多詳細資訊請參閱

DeepMind 發布了一份完整的技術報告,描述了方法論、加密保證以及試行結果。報告可於以下網址取得: https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/piloting-the-worlds-first-double-blind-ai-evaluations/double-blind-evaluations-technical-report.pdf

Outlook

此試行計畫旨在展示一個可擴展、具備隱私保護功能的評估流程,其他 AI 開發者與基準測試組織可以複製。透過建立一個值得信賴的雙盲測試機制,產業正朝向更可靠、透明且安全的 AI 性能報告邁進。


This article is based on DeepMind's official blog post dated August 27 2026.

Sources

相關