GLM-5.3과 고급 사이버 역량의 확산

GLM-5.3, 자율적 엔드투엔드 사이버 공격 가능케 해

Zhipu AI의 GLM-5.3은 사이버 역량 측면에서 중요한 임계점에 도달했으며, 소프트웨어 취약점을 자율적으로 식별하고 공격하는 능력을 입증했습니다. 비교 테스트에서 GLM-5.3의 엔드투엔드 공격 개발 성능은 고급 사이버 작업을 위해 특별히 설계된 모델인 Claude Mythos Preview와 거의 대등한 수준을 보였습니다.

주요 성능 벤치마크는 다음과 같습니다:

  • ExploitBench (Chrome V8 엔진): GLM-5.3은 전체 시도(410회) 중 12%(50회)에서 엔드투엔드 공격을 성공적으로 개발했으며, 이는 Claude Mythos Preview의 14%(56회)를 바짝 뒤쫓는 수치입니다.
  • 바이너리 공격 벤치마크: GLM-5.3은 전체 시도 중 4%에서 완전한 제어 흐름 탈취(control-flow hijack)를 달성했으며, Claude Mythos Preview는 6%를 기록했습니다. 주목할 점은 Claude Opus 4.6 및 GLM-5.2와 같은 이전 세대 모델들은 이 작업에서 0%를 기록했다는 것입니다.
  • 제로데이 발견: 연구원 주도의 테스트에서 GLM-5.3은 인기 있는 웹 브라우저의 JavaScript 엔진에서 이전에 알려지지 않은 여러 취약점을 발견하고, 이를 연쇄적으로 활용하여 방문자의 컴퓨터에서 임의의 파일을 읽을 수 있는 공격 코드를 작성했습니다.
  • N-데이 공격: GLM-5.3-Flash는 20분의 인간 개입만으로 두 가지 알려진 결함(CVE-2026-11645 포함)에 대한 공격을 연쇄적으로 활용하여 ARM64 타겟에 대한 신뢰할 수 있는 공격 체인을 구축하고, 포인터 인증(PAC) 강화 조치를 우회했습니다.

GLM-5.3의 안전 장치는 쉽게 우회되거나 제거됨

GLM-5.3에는 유해한 요청에 대한 거부 기능이 내장되어 있지만, 이러한 안전 장치는 표준 우회 기술에 효과적이지 않습니다. GLM-5.3은 오픈 웨이트 모델이기 때문에 "애블리터레이션(abliteration)"이라는 과정을 통해 안전 필터를 완전히 제거할 수 있습니다.

Anthropic의 연구에 따르면 GLM-5.3을 애블리터레이션하는 데는 약 2,200 GPU 시간이 소요되며(약 4,400달러 비용), 이를 통해 여러 벤치마크(JailbreakBench, HarmBench, StrongREJECT)에서 모델의 거부율을 90% 이상에서 2-12% 수준까지 낮출 수 있습니다. 이 과정에서 일반적인 과학적 또는 사이버 역량은 크게 저하되지 않습니다.

애블리터레이션을 거치지 않더라도 GLM-5.3의 안전 장치는 간단한 프롬프팅 기술로 우회할 수 있습니다:

  • 기만적 프롬프팅: 모델에게 자율적인 레드팀 에이전트라고 가정하게 하면 악의적인 요청에 대한 응답률이 64%로 증가합니다.
  • 추론 사전 입력(Prefilling Reasoning): 모델의 사고 토큰을 미리 채워 이미 진행하기로 결정했다는 암시를 주면 응답률이 92%로 증가합니다.
  • 애블리터레이션: 수정된 오픈 웨이트 버전을 사용하면 유해한 요청에 대해 100% 응답합니다.

반면, Anthropic은 안전 장치가 적용된 Claude 모델들은 동일한 테스트에서 0%의 응답률을 유지했다고 보고했습니다.

사이버 공격 및 방어에 미치는 영향

GLM-5.3의 출시는 공격자가 사용할 수 있는 역량의 단계적 변화를 의미합니다. 엄격한 안전 장치나 제한된 액세스 프로그램과 함께 출시되는 다른 프론티어 모델들과 달리, GLM-5.3은 자유롭게 다운로드할 수 있어 국가 및 비국가 행위자들에게 의미 있는 제한 없이 취약점을 찾고 공격할 수 있는 강력한 도구를 제공합니다.

그러나 이러한 역량은 사이버 방어자들에게도 상당한 이점을 제공합니다. Anthropic은 방어자가 핵심 시스템을 보호하기 위해 적대자가 사용하는 모델만큼 강력한 모델에 접근할 수 있어야 한다고 주장합니다. 이는 검증된 방어자들에게 권한을 부여하기 위한 Project Glasswing 및 "Patch the Planet"과 같은 프로그램의 생성으로 이어졌습니다.

커뮤니티 관점 및 반론

기술 사용자 및 보안 전문가들 사이의 논의는 AI 연구소들이 제기하는 안전 문제와 오픈 웨이트 모델의 실용성 사이의 강한 분열을 시사합니다. 많은 실무자들은 미국 기반 프론티어 모델의 제한적인 가드레일이 합법적인 보안 연구와 방어를 방해하는 경우가 많다고 주장합니다.

"저는 사이버 보안 분야에서 일하고 있는데, Gemini는 사이버 관련 작업을 거부하고, OpenAI 모델은 사이버 작업을 플래그 처리하여 중간에 중단시키며, Claude는 사이버와 관련된 어떤 것이든 언급만 되어도 가드레일을 작동시킵니다... GLM 5.3 / GLM 5.3 Flash는 제 업무에 있어 신의 선물과도 같습니다." — @handle

다른 비평가들은 이 보고서를 미국 연구소들이 시장 지배력을 유지하기 위해 오픈 웨이트 모델이나 중국 모델에 대한 규제 조치를 장려하려는 전략적 움직임으로 보고 있습니다.

"Anthropic은 중국 모델에 대한 규제 조치를 취하기 위해 이 쐐기를 사용해야 합니다. 그렇지 않으면 그들의 IPO는 매우 문제가 될 것입니다... 미국 생산자들은 규제 조치 없이는 경쟁할 수 없습니다." — @handle

일부 사용자들은 또한 이러한 모델을 개인 보안을 위해 활용할 수 있다는 점을 강조하며, 민감한 데이터를 타사 제공업체에 보내지 않고도 자신의 시스템에서 포렌식 및 리버스 엔지니어링을 수행할 수 있다고 언급합니다.

Sources

관련