GLM-5.3 출시: 프런티어 코딩 및 창발적 사이버 능력
TL;DR
GLM‑5.3은 동일한 베이스 모델에 대한 post‑training 스케일링을 통해 GLM‑5.2 대비 코딩 성능을 50% 향상시켰으며, 사이버 보안 벤치마크에서 새로운 오픈 소스 기록을 세웠습니다.
post‑training 스케일링이 중요한 이유
GLM‑5.3은 post‑training 단계만 스케일링해도 기본 아키텍처를 변경하지 않고도 큰 이득을 얻을 수 있음을 보여줍니다. Z.ai는 GLM‑5.2 베이스 모델을 재사용하고, 더 많은 long‑horizon 환경을 추가했으며, 연산량을 늘렸습니다. 그 결과, 오픈 웨이트(open-weights) 상태를 유지하면서도 코딩 및 보안 작업에서 더 큰 규모의 폐쇄형 경쟁 모델들을 능가하는 모델이 탄생했습니다.
더욱 강력해진 코딩 성능
핵심 성과
- Z.ai Code Bench: GLM‑5.2 대비 50% 향상.
- Terminal Bench 3.0: 28.3% vs. 4.6% (GLM‑5.2).
- DeepSWE v1.1: 66.9% vs. 46.2%.
- Agents' Last Exam: 28.5% vs. 23.8%.
성과 달성 방법
- 실제 환경 스케일링: Z.ai는 다일(multi-day) 엔지니어링 워크플로를 모방한 실행 가능하고 검증 가능한 수천 개의 작업을 합성했습니다 (예: ML 학습 파이프라인의 병목 현상 진단, 코드 최적화 및 측정 가능한 속도 향상 제공).
- 자동 환경 생성: 리서치 에이전트가 실제 작업에서 패턴을 수집하여 실행 가능한 long‑horizon 작업으로 변환하며, 심사(judge) 에이전트가 참조 솔루션 없이 해결 가능 여부를 검증합니다.
- SAO 압축을 통한 RL: GLM‑5.2에서 사용된 동일한 RL 전략(압축된 SAO)이 새로운 환경에 적용되어 long horizons에서의 개선 사항을 유지했습니다.
- 토큰 효율성: Z.ai Code Bench에서 GLM‑5.3은 약 75K 출력 토큰에서 34.5%의 성공률을 달성하여, 96K 토큰에서 23.4%를 기록한 GLM‑5.2를 앞질렀으며, 유사한 노력 대비 Claude Opus 4.8를 능가했습니다.
"GLM‑5.3은 성능과 토큰 효율성을 모두 향상시켰습니다. 모든 노력 수준에서 GLM‑5.2보다 눈에 띄게 강력한 에이전트 코딩 결과를 제공하면서도 더 적은 출력 토큰을 소비합니다." – Z.ai blog
창발적 사이버 능력
벤치마크 하이라이트
| 벤치마크 | GLM‑5.3 | GLM‑5.2 | 차순위 오픈 모델 |
|---|---|---|---|
| CyberGym (취약점 발견) | 84.5% | 77.2% | Mythos 5 (83.8%) |
| ExploitBench (전체 익스플로잇 체인) | 54.4% | 24.4% | Mythos 5 (78.0%) |
| ExploitGym (2h / 6h) | 105 / 130 tasks | 29 / 39 tasks | Mythos 5 (181 / 247) |
여기서 "창발적(emergent)"의 의미
post‑training 스케일링을 통해 취약점 발견 데이터가 도입되었으나, 모델은 빠르게 여러 익스플로잇 단계에 걸쳐 추론하는 법을 학습하여 일관된 엔드 투 엔드 공격 계획을 생성하게 되었습니다. 익스플로잇 체인의 상위에 위치한 벤치마크에서 더 큰 이득이 나타나는데, 이는 모델의 추론 깊이가 단순한 취약점 탐지 능보다 더 빠르게 확장되고 있음을 나타냅니다.
실제 영향
- 2,436개의 취약점이 269개의 OSS 프로젝트에서 발견되었으며, 여기에는 1,097개의 중등도~고위험 이슈가 포함됩니다.
- 가장 오래된 결함은 1981년까지 거슬러 올라갑니다; 발견 전 평균 수명은 26.6년이었습니다.
- 발견 사항은 공개된 Z.ai Security Disclosure Ledger (https://cvd.z.ai/)에서 추적되며, 공개된 CVE와 공개 유예(embargoed) 보고서가 구분됩니다.
"많은 결함이 수년 또는 수십 년 동안 발견되지 않은 채 남아 있었으며, 가장 오래된 것은 약 40년 전으로 거슬러 올라갑니다." – Z.ai blog
성과를 뒷받침하는 트레이닝 스택
slime 프레임워크
- 통합 데이터 흐름: Slime는 Megatron 트레이닝, SGLang rollouts, long‑horizon 환경을 단일 파이프라인으로 결합합니다.
- 알고리즘 업그레이드: top‑p mask, top‑k 및 전체 어휘 OPD, 그리고 R3 스타일의 수치 정렬(log‑prob drift < 1e-7, 99.99% 이상 감소)이 추가되었습니다.
- 시스템 효율성: 계층적 로컬 스토리지 캐싱과 multi‑teacher OPD가 메모리 압박을 줄이며, 워크로드 인식 스케줄링이 long‑horizon 코딩 작업에 대한 RL 처리량을 2.3배 향상시킵니다.
이러한 엔지니어링 발전 덕분에 매 릴리스마다 스택을 재구축하지 않고도 새로운 환경을 계속 추가하는 것이 실질적으로 가능해졌습니다.
API 변경 사항 및 사용 가이드
- 사고 노력 수준(Thinking effort levels):
low,high,max. 이전의thinking.type: "disabled"는 더 이상 지원되지 않습니다. - 기본 설정: 코딩 작업에는
reasoning_effort: "max"를 권장합니다. - 마이그레이션 팁: 모델 ID를 전환하기 전에 요청을
{ "model": "glm-5.3", "thinking": { "type": "enabled" }, "reasoning_effort": "low" }로 업데이트해야 하며, 그렇지 않으면 호출이 실패합니다.
커뮤니티 반응 (HN 댓글)
- 긍정적 반응: 사용자들은 명확한 엔지니어링 기술 문서와 오픈 소스 입장을 높이 평가했습니다. 한 댓글 작성자는 결과가 "그저 post‑training 마법이 적용된 GLM‑5.2"일 뿐이지만 여전히 인상적이라고 언급했습니다.
- 안전성 우려: 여러 사용자가 안전성 평가에 의문을 제기하며, 대규모 익스플로잇이 가능한 모델이 강력한 가드레일 없이 출시될 경우 위험할 수 있다고 지적했습니다.
- 오픈 소스 라이선스: 일부는 허용적인 FOSS 라이선스를 원한다고 표명했으며, 다른 이들은 다른 중국 모델들이 제한적 사용 조건으로 전환하고 있는 점을 강조했습니다.
- 멀티모달 격차: 반복되는 불만 사항은 비전(vision) 기능의 부재이며, 이는 스크린샷이나 UI 분석이 필요한 작업에 대한 적용 가능성을 제한합니다.
- 벤치마크 회의론: 몇몇 댓글 작성자들은 이러한 개선이 실제 능력을 반영하는지 아니면 벤치마크 세트에 대한 과적합(over-fitting)인지 질문했습니다.
전망
GLM‑5.3은 post‑training 스케일링이 코딩 및 보안 도메인 모두에서 더 큰 폐쇄형 모델과의 격차를 줄일 수 있음을 보여줍니다. 오픈 웨이트 릴리스(2주 내 예상)를 통해 커뮤니티가 모델을 더욱 감사하고, 확장하고, 벤치마킹할 수 있게 될 것입니다. 지속적인 발전은 다음 사항에 달려 있을 것입니다:
- 더 자율적인 환경 합성을 통한 human‑in‑the‑loop 병목 현상 감소.
- 실제 개발에서 흔히 발생하는 시각적 입력을 처리하기 위한 멀티모달 확장.
- 강력한 사이버 능력과 책임 있는 공개 사이의 균형을 맞추는 견고한 안전 프레임워크.
모든 벤치마크 수치는 Z.ai GLM‑5.3 블로그 포스트(2026년 8월 14일)와 관련 각주에서 직접 가져왔습니다. 외부 데이터는 조작되지 않았습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch