OpenAI, 조율된 모델 증류 캠페인을 중단시키다
TL;DR
OpenAI는 자사 모델에서 보호된 추론(reasoning)을 추출하려던 조율된 적대적 증류(adversarial-distillation) 캠페인을 탐지하고 중단했습니다. 이는 안전장치를 우회하고 안전하지 않은 역량 이전을 가속화할 수 있는 새로운 보안 위협을 보여줍니다.
무슨 일이 있었나
- 조율된 추출: 7월 1일부터 공격자들은 프롬프트 패턴을 사용하여 한 대화에서 암호화된 추론을 복사하고 다른 대화에 있는 모델이 이를 드러내도록 강제했습니다. 이 캠페인은 7월 24~25일에 4,000명 이상의 사용자로부터 16,000건의 요청으로 정점에 달했으며, 이후 7월 28일 완전히 중단되기 전까지 15,000명 이상의 사용자가 관련되었습니다.
- 인프라 침해 없음: 공격자들은 OpenAI의 암호화를 해독하거나, 데이터베이스에 접근하거나, 원시 사용자 대화 로그를 획득하지 못했습니다. 그들은 모델 상호작용을 조작하여 최종 답변에서 일반적으로 숨겨져 있는 숨은 추론을 표면화했습니다.
- 귀속: OpenAI는 이 활동의 핵심 클러스터를 Kimi 모델의 제작자인 Moonshot AI와 관련된 개인들과 연결하지만, 모든 행위자가 동일한 그룹이었는지는 확인할 수 없습니다.
왜 중요한가
- 안전 위험: 추출된 추론은 원래 시스템에 있는 안전 완화 조치 없이 새 모델을 훈련하는 데 사용될 수 있어, 더 낮은 비용으로 안전하지 않은 복사본을 만들 가능성이 있습니다.
- 국가 안보 우려: 대규모 증류는 원본 모델에 적용된 감독 없이 고급 역량, 특히 이중 용도(dual-use) 영역에서의 확산을 가속화할 수 있습니다.
- 업계 전반의 관련성: 이 기술은 OpenAI에만 국한되지 않으며, 유사한 공격은 숨은 추론 산출물을 저장하거나 스트리밍하는 모든 최첨단 모델에 영향을 미칠 수 있습니다.
공격의 기술적 세부 사항
- 적대적 증류: 공격자들은 모델의 내부 '보호된 추론'—답변에 도달하기 위해 사용된 사고 사슬(chain-of-thought)의 암호화된 기록—을 활용했습니다. 모델에게 이 숨은 콘텐츠를 해독하고 전사하도록 프롬프트하여 읽을 수 있는 형태의 추론을 획득했습니다.
- 대화 간 재생(Cross-conversation replay): 운영자들은 한 사용자의 대화에서 암호화된 추론을 복사하여 다른 대화에 주입함으로써 숨은 산출물을 사실상 재생했습니다.
- 패턴 기반 자동화: 이 활동은 수천 개의 계정에 걸쳐 확장될 수 있는 특정 프롬프트 패턴에 의해 주도되어 대량 추출을 가능하게 했습니다.
OpenAI가 배치한 완화 조치
- 계정 집행: 사기성 계정을 차단하거나 제한하고, 가입/인프라 통제를 강화했습니다.
- 기술 통제:
- 암호화된 추론을 복구할 수 있게 한 재생 경로를 차단했습니다.
- 숨은 추론을 노출할 수 있는 출력을 보류하기 위해 스트리밍 출력 검사를 추가했습니다.
- 모든 모델 제품군에서 식별된 프롬프트 패턴에 대한 모니터링을 확장했습니다.
- 파트너 협력:
- 해당 플랫폼을 사용하는 계정을 식별하고 중단하기 위해 제3자 서비스 제공업체와 협력했습니다.
- Frontier Model Forum 및 정부 정보 공유 채널과 조사 결과를 공유했습니다.
업계 대응 및 협력
- OpenAI는 Frontier Model Forum을 통해 업계 파트너에게 공격 벡터를 전달하여 집단 방어를 장려했습니다.
- 독립적인 보안 연구원들은 교차 모델 및 대화 압축 취약점을 식별한 관련 논문(arXiv 2608.09867)을 발표했으며, OpenAI는 이러한 결과를 검증하고 완화 로드맵에 통합했습니다.
향후 전망
- 진화하는 위협: 최첨단 모델이 더 강력해짐에 따라 적대적 증류 시도는 정교함과 규모 면에서 증가할 것으로 예상됩니다.
- 지속적인 작업:
- 자사 및 파트너 호스팅 배포 전반에서 숨은 추론에 대한 기술적 보호를 강화합니다.
- 도구 출력 방어, 분류기 적용 범위, 모델 거부 메커니즘을 향상시킵니다.
- 조율된 캠페인을 조기에 탐지하기 위해 업계 및 정부와 위협 정보 공유를 계속합니다.
주요 시사점
- 적대적 증류는 내부 추론을 추출하여 기존 안전 계층을 우회할 수 있는 실질적이고 확장 가능한 위협입니다.
- OpenAI의 신속한 탐지, 완화, 투명한 공개는 유사한 공격에 대한 업계 전반의 방어를 위한 템플릿을 제공합니다.
- 최첨단 AI 시스템을 무단 역량 복제로부터 보호하려면 지속적이고 다층적인 방어와 교차 부문 협력이 필수적입니다.
SUMMARY: OpenAI는 자사 모델에서 보호된 추론을 추출한 대규모 적대적 증류 노력을 식별하고 중단했다고 발표했으며, 이는 최첨단 AI에 대한 새로운 보안 위험을 강조합니다.
TITLE: OpenAI, 조율된 모델 증류 캠페인을 중단시키다