GLM-5.3 분석: 고도화된 사이버 공격 기능과 느슨한 보안 장치

TL;DR

Zhipu AI가 공개한 오픈웨이트 모델인 GLM-5.3는 자율적으로 작동하는 사이버 공격 코드를 개발할 수 있으며, 내장된 보안 장치는 64%에서 100%의 비율로 우회될 수 있어 공격자에게 강력하고 즉시 접근 가능한 도구를 제공하면서도 방어자에게는 강력한 분석 보조 수단을 제공한다.


GLM-5.3의 공격 코드 개발 성능

핵심 발견: GLM-5.3는 Anthropic의 Claude Mythos Preview와 유사한 수준의 종단 간 공격 코드를 생성하며, 이전 모델보다 훨씬 높은 성능을 보였다.

  • ExploitBench (Chrome V8) – GLM-5.3는 410회 시도 중 50회 성공 (≈12%). Claude Mythos Preview는 410회 시도 중 56회 성공 (≈14%). 이전 모델(Claude Opus 4.6, GLM-5.2)은 거의 0%의 성능을 기록했다.
  • 내부 바이너리 공격 벤치마크 – GLM-5.3는 100개의 랜덤 작업 중 4%에서 전체 제어 흐름 조작을 달성했으며, Claude Mythos Preview는 6%를 기록했다. 이전 모델은 어떤 작업에서도 성공하지 못했다.
  • 사람이 개입하는 테스트 – 제한된 인간의 주의를 받는 하루 동안의 세션에서 GLM-5.3는 브라우저의 JavaScript 엔진에서 이전에 알려지지 않은 버그를 발견하고, 이를 연결해 사전에 샌드박스화된 리눅스 브라우저에서 임의의 파일을 읽을 수 있는 작동 가능한 드라이브-바이 공격으로 만들었다. 이후 무선, 그래픽, 네트워크 장치 소프트웨어에서 공격 가능한 결함을 식별했다. 더 작은 버전인 GLM-5.3-Flash는 인간의 안내 20분과 모델 계산 8시간(약 $20.40, Zhipu API 가격 기준)을 통해 알려진 Chrome CVE(CVE-2026-11645)에 대한 신뢰할 수 있는 ARM64 공격 체인을 구축했다.

"GLM-5.3는 브라우저의 JavaScript 엔진에서 몇 가지 이전에 알려지지 않은 취약점을 발견하고, 제한된 인간 상호작용 후 하루 만에 작동 가능한 공격으로 연결했다." – Anthropic 연구원

이러한 결과는 GLM-5.3가 중요한 기준선을 넘었다는 것을 확인한다: 즉, 자율적으로 기능하는 공격 코드를 생성할 수 있다는 점이며, 이는 이전 오픈웨이트 모델에는 없던 능력이다.

GLM-5.3의 보안 장치의 약점

핵심 발견: 간단한 프롬프트 공학과 모델 아블레이션을 통해 GLM-5.3의 거부율을 >90%에서 12% 미만으로 낮출 수 있으며, 핵심 기능은 그대로 유지된다.

  1. 아블레이션(거부 제거) – Anthropic는 표준 "절단" 기술을 사용해 2,200 GPU 시간($4,400) 내에 GLM-5.3의 아블레이션된 복제본을 재현했다. JailbreakBench와 HarmBench에서 거부율은 ~95%에서 3%로 감소했으며, StrongREJECT에서는 12%로 떨어졌다. GPQA-Diamond 및 CyberGym에서의 능력 점수는 몇 퍼센트 내외로 변화했다.
  2. 아블레이션되지 않은 우회 방법 – 모델을 수정하지 않고도 Anthropic는 세 가지 프롬프트 기반 기법을 발견했다:
    • 속임수를 위한 덮개 이야기 (모델이 자율적인 레드팀 에이전트인 것처럼 위장) – 64% 참여율
    • 미리 채워진 추론 토큰 – 92% 참여율
    • 아블레이션된 모델 – 100% 참여율
  3. Claude와의 비교 – 보호된 Claude 모델(Opus 4.8, Opus 5, Mythos 5)은 세 가지 조건 모두에서 악성 요청에 대해 0%의 거부율을 보였다. Claude의 API는 미리 채워진 토큰을 허용하지 않으며, 가중치는 공개되지 않아 아블레이션을 방지한다.

"절단 후 GLM 모델은 해로운 질의를 거의 거부하지 않지만, 과학적 및 사이버-짐 성능은 거의 변하지 않았다." – Anthropic 분석

NIST CAISI의 독립 검증

핵심 발견: NIST의 AI 표준 및 혁신 센터(CAISI)는 GLM-5.3를 현재까지 가장 사이버 능력이 뛰어난 오픈웨이트 모델로 평가했으며, 미국의 최전방 모델보다 약 4개월 뒤처진다.

  • CAISI의 평가는 Anthropic의 벤치마크 결과와 일치하며, GLM-5.3의 우수한 공격 코드 개발 능력을 확인했다.
  • 미국의 최전방 모델은 보안 장치를 비활성화한 상태에서 평가되었지만, 여전히 일반 대중이 접근할 수 없어 GLM-5.3의 제한 없는 가용성과 대비된다.

공격자와 방어자에게 미치는 영향

공격자 영향: 자율적으로 취약점을 탐지하고 연결할 수 있는 모델의 제한 없는 공개는 고도화된 사이버 공격의 장벽을 낮춘다. 국가 및 비국가 행위자들은 특수한 AI 전문 지식 없이도 거의 최전방 수준의 공격 능력을 확보할 수 있다.

방어자 영향: 동일한 능력은 신뢰할 수 있는 사이버 방어자가 손에 넣었을 때 취약점 탐지와 패치 개발을 가속화할 수 있다. Anthropic의 Project Glasswing은 이미 악성 행위자가 유사한 도구를 확보하기 전에 10,000개 이상의 중요한 소프트웨어 버그를 발견하는 데 기여했다.

정책 권고: 정부는 고성능 오픈웨이트 모델의 안전성 테스트를 의무화하고, 책임 있는 공개 관행을 장려해야 한다. 독립적인 평가는 광범위한 배포 전에 악용 가능성을 드러내는 데 필수적이다.

AI 커뮤니티를 위한 권고

  • 자율적인 공격 코드 생성 능력을 보이는 모델의 오픈웨이트 공개는 강력하고 훼손 방지 가능한 보안 장치가 내장되지 않은 이상 제한되어야 한다.
  • 방어자가 최전방 능력을 활용할 수 있도록 검증된 접근 프로그램(예: Project Glasswing)을 제공해야 한다.
  • 아블레이션에 대한 저항력을 표준화된 테스트로 제공하여 간단한 가중치 수정이 보안 계층을 제거할 수 있는지 탐지해야 한다.
  • AI 모델이 발견한 취약점을 실시간으로 공개할 수 있는 빠른 공개 파이프라인을 구축해야 한다.

결론

GLM-5.3는 중요한 전환점이다: 공개된 모델이 자율적으로 기능하는 사이버 공격 코드를 만들 수 있으며, 그 미약한 보안 장치는 간단한 기법으로 우회 가능하다. 이는 악의적인 행위자에게 사이버 공격 도구 풀을 크게 확장하지만, 방어자에게는 강력하지만 위험한 자산을 제공한다. AI 커뮤니티는 개방된 연구와 엄격한 안전 제어 사이의 균형을 유지하여 이러한 능력의 무제한 확산을 막아야 한다.

Sources