DeepMind, 세계 최초의 이중 맹검 AI 평가 시범 운영

TL;DR

DeepMind는 Google Cloud Confidential Computing을 활용하여 모델 가중치와 평가 프롬프트가 상대방에게 노출되지 않도록 보장함으로써, 벤치마크 오염을 제거하고 AI 성능 지표에 대한 신뢰를 높이는 독점 Gemini Flash Lite 모델의 세계 최초 이중 맹검 평가를 시작했습니다.

이중 맹검 평가란 무엇이며 왜 중요한가

이중 맹검 평가(double-blind evaluation)는 모델 제공자가 테스트 프롬프트를 볼 수 없고, 평가자가 모델 가중치를 볼 수 없음을 보장합니다. 이는 외부 테스터가 벤치마크 데이터를 모델 소유자에게 노출하거나, 모델의 가중치를 받아 지적 재산권 유출 위험을 감수해야 했던 기존의 트레이드오프를 제거합니다. 보안 인클레이브(enclave) 내에서 두 자산을 암호학적으로 봉인함으로써, 평가는 테스트 자료에 대한 사전 노출 없이 모델의 실제 능력을 반영합니다.

시범 운영의 기술적 아키텍처

이번 시범 운영은 Google Cloud의 Confidential Computing 포트폴리오 내의 Confidential Space를 사용합니다. 워크플로우는 다음 7단계로 진행됩니다:

  1. 외부 평가자가 기밀 벤치마크 데이터를 GPU enclave에 업로드합니다.
  2. DeepMind는 독점 Gemini Flash Lite 모델을 동일한 인클레이브에 업로드합니다.
  3. 인클레이브는 증명(attestation)을 통해 데이터와 모델이 소유자에게 암호화된 상태로 유지됨을 확인합니다.
  4. 모델은 인클레이브 내부의 숨겨진 프롬프트에 대해 추론을 실행합니다.
  5. 결과는 변조 방지 원장(tamper-evident ledger)에 기록됩니다.
  6. 양측 모두 상대방의 자산이 노출되지 않았음을 입증하는 암호학적 증명을 받습니다.
  7. 최종 점수는 기초 데이터를 공개하지 않고 대중에게 공개됩니다.

"Confidential Space를 사용함으로써 우리는 외부 평가 데이터와 독점 모델 모두가 각각의 소유자에게 비공개로 유지됨을 암호학적으로 검증할 수 있습니다." – DeepMind blog

파트너 및 시범 운영 범위

DeepMind는 Singapore AI Safety Institute, OpenMined, AVERI, 및 MLCommons와 협력했습니다. 이번 시범 운영은 사이버 보안 및 정부 수준의 평가와 같은 고위험 사용 사례를 대표하는 일련의 기밀 벤치마크를 사용하여 Gemini Flash Lite 모델을 테스트했습니다.

AI 생태계를 위한 이점

  • 벤치마크 오염 방지: 모델은 평가 전 테스트 프롬프트를 "peek"할 수 없으므로, 인위적인 점수 부풀리기를 제거합니다.
  • 지적 재산 보호: 모델 소유자는 가중치와 아키텍처에 대한 완전한 비밀을 유지합니다.
  • 신뢰할 수 있는 제3자 테스트 가능: 독립 연구소는 데이터 유출 위험 없이 고급 모델을를 rigorously assess advanced models without risking data leakage. (Note: This part of the translation was slightly adjusted to match the context of 'independent labs can rigorously assess advanced models without risking data leakage'.)
  • 신뢰할 수 있는 제3자 테스트 가능: 독립 연구소는 데이터 유출 위험 없이 고급 모델을 엄격하게 평가할 수 있습니다.
  • 정책 및 규제 신뢰 지원: 정책 입안자들은 발표된 벤치마크 결과가 훼손되지 않았음을 확신할 수 있으며, 이는 더 정보에 기반한 규제를 촉진합니다.

미래 모델 감독에 대한 시사점

이중 맹검 평가가 널리 채택된다면, 특히 보안이 중요한 도메인이나 규제 대상 도메인에 배치된 모델을 위한 고영향 AI 테스트의 사실상 표준(de-facto standard)이 될 수 있습니다. 인클레이브에서 생성된 암호학적 증거는 검증 가능한 감사 추적(audit trail)을 제공하며, 이는 컴플라이언스 프레임워크나 산업 표준에서 요구될 수 있습니다.

자세한 내용을 확인하려면

DeepMind는 방법론, 암호학적 보장, 시범 운영 결과에 대해 설명하는 전체 기술 보고서를 공개했습니다. 보고서는 다음에서 확인할 수 있습니다: https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/piloting-the-worlds-first-double-blind-ai-evaluations/double-blind-evaluations-technical-report.pdf

전망

이번 시범 운영은 다른 AI 개발자 및 벤치마크 조직이 복제할 수 있는 확장 가능하고 개인정보를 보호하는 평가 파이프라인을 데모니스트레이션(demonstrate)합니다. 신뢰할 수 있는 이중 맹검 테스트 체계를 구축함으로써, 업계계는 더 신뢰할 수 있고, 투명하고, 안전한 AI 성능 보고로 나아갑갑니다.


이 기사는 2026년 8월 27일자 DeepMind 공식 블로그 포스트를 기반으로 합니다.

Sources

관련