증류 공격 탐지 및 방지에 관한 Anthropic 보고서
Anthropic은 DeepSeek, Moonshot, MiniMax 등 세 곳의 AI 연구소에서 Claude의 능력을 불법적으로 추출하여 자신들의 모델을 개선하려는 산업 규모의 캠페인을 발견했습니다. 이 연구소들은 약 24,000개의 허위 계정을 사용하여 1,600만 건 이상의 교환을 생성했으며, 이는 서비스 약관 및 지역적 접근 제한을 위반한 것입니다.
불법 증류의 메커니즘과 위험성
증류(Distillation)는 성능이 낮은 모델을 더 강력한 모델의 출력물을 통해 학습시키는 정당한 훈련 방법입니다. 그러나 불법 증류는 경쟁업체가 독자적인 개발에 필요한 시간과 비용의 극히 일부만 사용하여 강력한 능력을 습득할 수 있게 합니다.
국가 안보 및 안전 위험
불법적으로 증류된 모델은 종종 프런티어 모델에 구축된 핵심적인 안전 장치를 결여하고 있습니다. 이는 위험한 능력—예를 들어 생물 무기 개발이나 악의적인 사이버 활동에 사용되는 능력—이 보호 장치 없이 확산될 수 있기 때문에 심각한 국가 안보 위험을 초래합니다. 이러한 보호되지 않은 능력은 군사, 정보 및 감시 시스템에 통합되어 권위주의 정부에 의한 공격적 사이버 작전, 대량 감시 및 허위 정보 캠페인을 가능하게 할 수 있습니다.
수출 통제에 미치는 영향
증류 공격은 AI 분야에서 경쟁 우위를 유지하기 위해 설계된 미국의 수출 통제를 약화시킵니다. Anthropic은 해외 연구소들의 급격한 진보는 종종 독자적인 혁신의 결과가 아니라 미국 모델에서 추출된 능력에 의존하고 있다고 언급합니다. 이러한 공격을 대규모로 실행하려면 고급 칩이 필요하기 때문에, 제한된 칩 접근 권한은 직접적인 모델 훈련과 불법 증류의 규모를 모두 제한하는 중요한 도구로 남아 있습니다.
특정 증류 캠페인 분석
Anthropic은 IP 주소 상관관계, 요청 메타데이터, 인프라 지표 및 업계 파트너의 확인을 바탕으로 세 가지 뚜렷렷한 캠페인을 특정 연구소의 소행행으로 규정했습니다. 각 캠페인은 에이전트 추론, 도구 사용, 코딩 등 Claude의 가장 차별화된 능력을 목표로 삼았습니다.
DeepSeek
DeepSeek는 추론 능력, 강화 학습을 위한 루브릭 기반 채점, 그리고 정책 민감 질문에 대한 검열 안전 대안 생성 등을 목표로 150,000건 이상의 교환을 수행했습니다.
주요 기술은 다음과 같습니다:
- Chain-of-Thought Generation: Claude에게 내부 추론 과정을 단계별로 설명하도록 유도하여 훈련 데이터를 생성합니다.
- Censorship Steering: 반체제 인사나 권위주의에 관한 질문에 대한 대안을 생성하도록 Claude를 사용하여, 모델이 검열 대상 주제를 피하도록 훈련시킵니다.
- Coordinated Traffic: 처리량을 높이고 탐지를 피하기 위해 계정 간에 동기화된 트래픽, 공유 결제 수단 및 "load balancing"을 활용합니다.
Moonshot AI
Moonshot (Kimi 모델)은 에이전트 추론, 도구 사용, 코딩, 데이터 분석, 컴퓨터 사용 에이전트 개발 및 컴퓨터 비전에 초점을 맞춰 340만 건 이상의 교환을 수행했습니다. Moonshot는 수백 개의 허위 계정을 사용했으며, 이후 Claude의 추론 흔적을 추출하고 재구성하려는 시도를 했습니다.
MiniMax
MiniMax는 에이전트 코딩, 도구 사용 및 오케스트레이션을 목표로 1,300만 건 이상의 교환을 수행했습니다. Anthropic은 이 캠페인이 여전히 활발한 상태일 때 이를 탐지했으며, MiniMax가 최신 시스템의 능력을 포착하기 위해 새로운 Claude 모델 출시 24시간 이내에 트래픽을 전환하는 것을 관찰했습니다.
증류업자들이 접근 제어를 우회하는 방법
Anthropic은 중국이나 해외에 있는 중국 기업의 자회사에 Claude에 대한 상업적 접근을 제공하지 않기 때문에, 공격자들은 상업용 프록시 서비스를 사용합니다. 이러한 서비스는 "hydra cluster" 아키텍처—API와 제3자 클라우드 플랫폼에 트래픽을 분산시켜 단일 장애점을 제거하는 허위 계정의 거대한 네트워크—를 채택합니다.
한 사례에서는, 단일 프록시 네트워크가 20,000개 이상의 허위 계정을 동시에 관리하며, 증류 트래픽을 합법적인 고객 요청과 섞어 운영을 은폐했습니다.
탐지 및 대응 전략
Anthropic은 증류 공격을 식별하고 완화화하기 위해 여러 단계의 방식을 도입하고 있습니다:
- Detection Systems: chain-of-thought elicitation 및 대규모 계정 볼륨을 통한 조정된 활동과 같은 패턴을 식별하기 위한 분류기 및 행동 지문 생성 기술을 개발합니다.
- Intelligence Sharing: 기술적 지표를를 함께 다른 AI 연구소, 클라우드 제공업체 및 정부 당국과 공유합니다.
- Access Controls: 교육용 계정, 보안 연구 프로그램 및 스타트업 조직은 흔히 악용되는 경로이므로, 이들에 대한 검증을 강화합니다.
- Countermeasures: 합법적인 사용자의 영향을 받지 않으면서 불법 증류를 위한 출력물의 효능을 줄이기 위해 제품, API 및 모델 수준의 안전 장치를 개발합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch