Google HEIR: 동형 암호를 통한 프라이빗 AI 추론 구현

Google은 암호학적으로 안전한 프라이빗 AI 추론을 가능하게 하도록 설계된 오픈 소스 컴파일러 툴체인인 **HEIR (Homomorphic Encryption Intermediate Representation)**를 도입했습니다. 동형 암호를 활용함으로써, HEIR는 AI 모델이 암호화된 입력을 처리하고 암호화된 결과를 반환할 수 있게 하며, 서비스 제공자가 기본 원시 데이터에 전혀 접근할 수 없도록 합니다.

동형 암호를 통한 프라이버시-유틸리티 트레이드오프 해결

전통적인 데이터 보호 방식은 종종 보안과 기능성 사이의 선택을 강요합니다. 종단간 암호화는 데이터 유출로부터 데이터를 보호하지만 서비스 제공자가 유용한 계산(스팸 탐지 또는 개인화된 추천 등)을 수행하는 것을 방지합니다. 반대로, 로컬 처리는 프라이버시를 보호하지만 기기 하드웨어의 한계가 있고 제공자의 독점적인 모델 IP 유출 위험이 있습니다.

동형 암호(HE)는 암호문 위에서 직접 계산을 수행할 수 있게 함으로써 이 문제를 해결합니다. 이는 과제를 "프라이버시 대 유틸리티"라는 이분법적 선택에서 계산 비용의 문제로 전환시킵니다. HE는 역사적으로 상당한 성능 오버헤드가 수반되지만, Google은 이러한 비용이 빠르게 감소하고 있다고 주장합니다.

HEIR: 암호화된 추론을 위한 오픈 소스 컴파일러

프로그램을 동형 암호 사용 방식으로 수동으로 변환하는 것은 일반적으로 전문적인 암호학적 지식이 필요하기 때문에, Google은 이 과정을 자동화하기 위해 HEIR를 개발했습니다.

주요 기능

  • Model Conversion: HEIR는 일반적으로 암호화되지 않은 데이터에서 작동하는 사전 학습된 AI 모델을 암호화된 입력에서 작동할 수 있도록 변환할 수 있습니다.
  • Developer Accessibility: 이 프로젝트는 비전문가도 프로덕션 애플리케이션에 암호화된 추론을 통합할 수 있도록 하는 "one-click solution"을 목표로 합니다.
  • Research Ecosystem: HEIR는 암호학자들이 최적화 작업을 테스트하고 벤치마크할 수 있는 플랫폼 역할을 하며, Carnegie Mellon, Georgia Tech, Tsinghua University와 같은 기관과의 협업으로 이어지고 있습니다.
  • Hardware Acceleration: Google은 HE 계산과 관련된 지연 시간을 줄이기 위해 Belfort, Niobium, Cornami, Optalysys를 포함한 하드웨어 가속기 개발업체들과 파트너십을 맺고 있습니다.

프라이빗 추론의 실제 적용 사례

Google은 HEIR로 컴파일된 네 가지 구체적인 사용 사례를 시연했습니다. 성능 지표는 단일 스레드 CPU 실행을 기준으로 합니다:

  • Deep Learning Recommendation Models: 사용자 특징을 노출하지 않고 프라이빗한 콘텐츠 추천을 가능하게 합니다.
  • Credit Card Fraud Detection: 민감한 금융 데이터를 암호화된 상태로 유지하면서 사기 거래를 식별합니다.
  • Threat Intrusion Detection: Kitsune 시스템을 사용하여 패킷 내용을 공개하지 않고 암호화된 네트워크 트래픽에서 이상 징후를 탐지합니다.
  • Hotword Detection: AI 에이전트가 트리거 단어를 인식할 수 있게 하면서 주변 오디오 녹음의 프라이버시를를 보호합니다.

기술적 비판 및 커뮤니티 관점

Google이 HEIR를 실용적인 프라이빗 AI를 향한 단계로 제시하고 있지만, Hacker News의 기술 커뮤니티는 그 실용성에 대해 몇 가지 중요한 반론을 제기했습니다:

계산 오버헤드 및 에너지 비용

여러 기여자는 동형 암호가 종종 엄청난 리소스 오버헤드를 초래하며, 때로는 암호화되지 않은 추론 비용의 $10^3$에서 $10^6$배로 추정된다고 언급했습니다.

"My master's thesis is on a topic in this field (Privacy Preserving ML) and from my understanding HE and other techniques have very high overheads(~10^3) on inference tasks and thus aren't very commercially viable."

비판론자들은 이러한 비효율성이 다른 프라이버시 솔루션과 비교했을 때 환경적으로 지속 불가능하고 경제적으로 비실용적이라고 주장합니다.

로컬 실행 vs. 클라우드 암호화

반복되는 논점은 사용자 제어 하드웨어에서 오픈 웨이트 모델을 로컬로 실행하는 것이 복잡한 encryption scheme을 사용할 필요 없이 우수한 프라이버시와 효율성을 제공한다는 것입니다.

"Private AI is practical by running the model locally... All of the privacy from unplugging your internet cable is there by default."

신뢰 및 검증

일부 사용자들은 "프라이빗 클라우드" 모델에 요구되는 신뢰 수준에에 대해 의문을 제기하며, 데이터가 제3자 서버에 남아 있다면 암호화 방식과 관계없이 진정으로 프라이빗하지 않다고 제안했습니다.

핑거프린팅의 가능성

암호화된 입력이라 하더라도, 계산 결과가 반복적인 쿼리를 통해 사용자를 핑거프린팅하거나 민감한 정보를 추론할 수 있는 가능성이 제기되었습니다.

Sources

관련