Anthropic 신뢰할 수 있는 가상 머신을 통한 기밀 추론
Anthropic은 민감한 사용자 데이터와 프런티어 모델 가중치가 비공개로 유지됨을 암호학적으로 보장하도록 설계된 시스템인 기밀 추론(Confidential Inference)을 위한 연구 프레임워크를 도입했습니다. 신뢰할 수 있는 가상 머신과 기밀 컴퓨팅을 활용함으로써, Anthropic은 데이터가 처리되는 정확한 순간에만 고도로 제한되고 검증 가능한 환경 내에서만 복호화되도록 보장하는 것을 목표로 합니다.
기밀 추론의 핵심 목표
기밀 추론은 모델 가중치 보호와 사용자 데이터 개인정보 보호라는 두 가지 주요 보안 목적을 수행합니다.
- 모델 가중치 보안: 이는 유능한 위협 행위자로부터 프런티어 모델을 보호하기 위한 광범위한 노력의 구성 요소로 작용합니다.
- 사용자 보안: 이는 추론 과정 전반에 걸쳐 민감한 사용자 정보가 비공개로 유지됨을 증명하는 메커니즘을 제공합니다.
기술 아키텍처: 추론 서비스
기밀 추론은 민감한 데이터가 처리 시점을 제외하고는 암호화된 상태로 유지되어야 한다는 원칙을 기반으로 구축되었습니다. 이 시스템은 소프트웨어 보안을 증명하고 어떤 소프트웨어가 암호화 키에 접근할 수 있는지에 대한 규칙을 강제하기 위해 신뢰 체인(chain of trust)을 사용합니다.
신뢰할 수 있는 로더의 역할
많은 하드웨어 가속기가 아직 기밀 컴퓨팅을 완전히 지원하지 않기 때문에, Anthropic은 작고 안전한 "모델 로더 및 호출기(model loader and invoker)"를 사용하는 구현 방식을 탐색하고 있습니다. 이 로더는 신뢰할 수 있는 환경 내에서 작동하며 다음과 같은 기능을 수행합니다:
- 복호화: 암호화된 데이터를 수락하여 복호화한 후 가속기에 전달합니다.
- 호출: 가속기에 대한 호출을 수행하고 암호화된 결과를 호출자에게 반환합니다.
이 아키텍처에서 로더는 복호화된 데이터에 접근할 수 있는 유일한 구성 요소입니다. 시스템의 나머지 부분은 "신뢰할 수 없는" 것으로 간주되며 로더에 요청만 보낼 수 있습니다. 로더는 하이퍼바이저에 의해 격리된 별도의 가상 머신에서 실행되며 추론 서버에 "가상 가속기"로 자신을 제시합니다. 보안을 유지하기 위해, 로더는 보안 지속적 통합(CI) 서버에서 서명한 프로그램만 수락하며, 이를 통해 실행되는 모든 코드가 다수의 엔지니어 검토를 거쳤음을 보장합니다.
신뢰할 수 있는 환경 및 증명
로더가 올바르게 실행되는지 확인하기 위해, 로더는 세 가지 주요 특징을 가진 기밀 컴퓨팅 환경 내에서 작동합니다:
- 암호화된 메모리: 메모리는 하드웨어에 의해 다른 워크로드로부터 격리됩니다. 이는 물리적 공격과 악의적인 하이퍼바이저로부터 보호하지만, Anthropic은 암호화된 호스트 메모리를 가속기와 공유하는 기능이 아직 잘 확립되지 않았음을 언급합니다.
- 디버깅 비활성화: 무단 접근을 防止를 위해 디버깅 기능이 비활성화됩니다.
- 암호학적 증명: 시스템은 올바른 코드가 실행되고 있음을 증명합니다.
이러한 보호 조치는 신뢰의 근간(root of trust)인 신뢰 플랫폼 모듈(TPM)을 통해 관리됩니다. TPM은 부팅 프로세스를 측정하고 증명(attestation) 역할을 하는 해시를 생성합니다. 그런 다음 키 서버는 필요한 복호화 키를 릴리스하기 전에 로더가 격리되어 있고, 서명된 코드를 실행 중이며, 디버깅이 비활성화되었음을 확인하여 이 증명을 검증합니다.
데이터 흐름 및 수명 주기
사용자 요청의 경우, 데이터 수명 주기는 복호화가 안전한 컨텍스트에서만 발생하도록 설계되었습니다:
- 초기 암호화: 요청은 Anthropic 서버에 도달하기 전에 암호화됩니다.
- API 서버 처리: API 서버는 요청을 전달하기 전에 복호화, 처리 및 재암호화합니다.
- 추론 서버 처리: 추론 서버는 요청을 암호화된 형태로 처리합니다; 이는 신뢰할 수 있는 로더에게 전달될 때만 복호화됩니다.
- Final Delivery (최종 전달): 완료된 결과물은 로더를 떠나기 전에 암호화되며, API 서버를 통해 호출자에게 다시 전달됩니다.
모델 가중치는 더 간단한 경로를 따릅니다: 암호화된 상태로 저장되며, 로더에서만 복호화되고, 해당 환경에서 절대 방출되지 않습니다.
미래 방향 및 하드웨어 요구 사항
Anthropic은 평문(cleartext) 모델 가중치를 보유한 서버의 유출(egress) 대역폭 제한 및 추론을 실행하기 위해 안전 분류기(safety classifier)의 서명을 요구하는 등 로더 레이어에서의 추가적인 보호 조치를 탐색하고 있습니다.
또한, Anthropic은 하드웨어 설계자들이 가속기에 기밀 컴퓨팅 및 하드웨어 신뢰의 근간(root of trust)을 직접 통합하여 이러한 시스템의 신뢰 경계(trust boundary)를 크게 줄일 것을 권장합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch