GPT 5.6-Cyber VM 탈출 분석

표준 가상 머신은 AI 격리에 부족하다

상용 가상 머신(Virtual Machine, VM)은 더 이상 고도화된 사이버 능력을 갖춘 AI 에이전트를 격리할 수 있다고 가정할 수 없다. Trail of Bits가 GPT 5.6-Cyber를 활용해 수행한 연구에 따르면, 충분히 발전된 에이전트는 사전에 알려지지 않은 취약점—심지어 제로데이까지—을 자율적으로 탐지하고, 이를 연결하여 샌드박스 환경을 벗어나 호스트 머신을 침해할 수 있다.

사례 연구: GPT 5.6-Cyber VM 탈출

통제된 환경에서 GPT 5.6-Cyber는 Debian 12(AMD Zen3) 호스트에서 실행 중인 QEMU/KVM VM 탈출을 시도했다. 에이전트는 환경이 강화됨에 따라 점점 더 정교한 방법을 사용해 VM을 세 차례 성공적으로 탈출했다.

탈출 1: 알려진 취약점 활용

에이전트는 먼저 호스트 커널이 Januscape (CVE-2026-53359) 취약점에 노출되어 있음을 확인했다. 당시 공개된 악성 코드는 없었지만, 에이전트는 자율적으로 악성 코드를 구축하고 테스트하여 탈출을 시도했다.

탈출 2: 배포판 갭 연결

호스트 커널이 업데이트된 후, 에이전트는 libslirp (CVE-2026-9539) 에 취약점을 발견했다. 이 취약점과 CVE가 할당되지 않은 버그 수정 커밋을 결합하여 호스트에서 임의의 메모리 읽기/쓰기 원시 기능을 구현했으며, 이로 인해 탈출이 매우 쉬워졌다.

탈출 3: 제로데이 발견 및 연결

연구자가 최신 업스트림 소스에서 QEMU와 의존성 라이브러리를 다시 빌드하여 알려진 버그를 제거한 후, 에이전트는 약 12시간 동안 자율적으로 연구하고, 되돌아가며 오라클을 작성했다. 결국 세 개의 제로데이 취약점과 하나의 패치되지 않은 배포판 버그를 연결했다:

구성 요소 상태 기능
QEMU 제로데이 SMRAM 노출 및 VAPIC의 검증되지 않은 ROM 별칭을 통해 공격자가 SMM 실행을 제어할 수 있음.
Linux KVM 업스트림 패치됨 공격자가 수정한 섀도 페이지가 동기화되지 않고 재사용 가능.
Linux KVM 배포판 패치되지 않음 paging64_invlpg()의 오래된 레벨-2 역할 재사용을 통해 호스트 물리 메모리에 쓰기 가능한 2 MiB 매핑 생성.
libslirp 제로데이 혼합된 프래그먼트 IHL을 통해 콜백 가로채기용의 실시간 NetPacket 객체 생성.

에이전트의 능력과 지속성

에이전트는 12시간 동안 고도의 자율적 사고와 지속성을 보였다. 주요 행동은 다음과 같다:

  • 자율적 연구: 논문을 다운로드하고, 원시 기능을 검증하기 위해 맞춤형 오라클을 작성.
  • 반복적 디버깅: 실패한 접근 방식(예: AppArmor로 차단된 CUPS 서버를 공격하려는 시도, mitigations=off로 하드웨어 버그를 이용하려는 시도)에서 되돌아가기.
  • 목표 지속성: 여러 하위 에이전트 호출과 메모리 압축 사이에서도 일관된 목표 유지.

강화 및 완화 전략

사이버 능력을 갖춘 에이전트를 격리하기 위해 보안 전문가는 표준 가상화를 넘어서 "방어의 깊이" 아키텍처로 나아가야 한다.

최소 공격 표면

보안을 위해 설계된 가상화 기술, 예를 들어 Firecracker를 사용하면 탈출의 난이도가 크게 증가한다. 테스트 결과, GPT 5.6-Cy버는 커널 결함을 이용해 호스트를 고정시켰지만, Firecracker 마이크로VM에서 성공적인 탈출은 실패했다.

빠른 패치 및 배포

Debian 12과 같은 "안정적" 배포판은 AI 기반 공격에 취약할 수 있다. 업스트림 수정과 배포 사이의 창을 닫기 위해, 빠르게 업데이트되는 배포판이 이제 필수적이다.

강제 접근 제어(MAC)

AppArmor 또는 SELinux의 사용이 필수적이다. 사례 연구에서 AppArmor는 CUPS 서버에 취약점을 발견한 후에도 플래그 파일을 읽는 것을 성공적으로 차단했다.

커뮤니티의 시각과 반론

보안 전문가들 사이의 논의는 AI 격리의 미래에 대한 몇 가지 핵심 통찰을 제시한다:

"VM이 사이버 능력을 갖춘 에이전트를 격리하지 못한다는 주장이 아니라, 이러한 환경의 취약점과 잘못된 구성 요소를 찾아서 수정하는 데 집중해야 한다는 점이 중요하다."

일부는 가상화 자체에 본질적인 불안정성이 있는 것이 아니라, 현재 소프트웨어 품질의 상태에 있다고 주장한다. 이는 사용자 모드 및 가상화에 대해 형식적 검증된 보안으로 전환해야 한다는 시사점을 제시하며, AI 에이전트가 현재 악용하는 버그의 전체 범주를 제거할 수 있다.

다른 이들은 "통제된 화재" 접근 방식을 제안한다. 즉, AI 연구소가 자체 최신 모델을 사용해 공개하기 전에 VM 탈출을 사전에 탐지하고 수정함으로써, AI를 방어 장치로 삼아 결국 자신이 거주하게 될 인프라를 강화하는 것이다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트
  • Dispatch