GLM-5.2: 장기 과업(Long-Horizon Tasks)을 위해 구축됨
GLM-5.2: 장기 과업(Long-Horizon Tasks)을 위해 구축됨
GLM-5.2 개요
GLM-5.2는 장기 과업을 위해 설계된 플래그십 모델로, 견고한 1M-token 컨텍스트를 특징으로 하며 MIT 오픈 소스 라이선스로 출시되었습니다.
주요 역량
GLM-5.2는 장기 작업을 지속할 수 있는 견고한 1M-token 컨텍스트, 유연한 노력 수준을 갖춘 고급 코딩, 계산 비용을 줄이는 아키텍처 개선, 그리고 완전한 오픈 액세스를 제공합니다.
견고한 1M 컨텍스트
GLM-5.2는 코딩 에이전트 시나리오를 위해 1M-context 학습을 실질적으로 확장함으로써, 단순히 더 많은 토큰을 수용하는 것을 넘어 길고 복잡한 코딩 에이전트 궤적 전반에 걸쳐 품질을 유지합니다.
유연한 노력을 통한 고급 코딩
GLM-5.2는 성능과 지연 시간의 균형을 맞추기 위해 여러 사고 노력(thinking effort) 수준을 제공하여, 사용자가 더 높은 성능이 필요할 때 추가 계산 자원을 할당할 수 있도록 합니다.
개선된 아키텍처
GLM-5.2는 IndexShare를 도입하여 매 4개의 sparse attention 레이어마다 동일한 인덱서를 재사용함으로써 1M 컨텍스트 길이에서 토큰당 FLOPs를 2.9× 감소시켰으며, 투기적 디코딩(speculative decoding)을 위한 MTP 레이어를 개선하여 수락 길이(acceptance length)를 최대 20%까지 증가시켰습니다.
순수 오픈 소스
GLM-5.2는 지역적 제한 없이 MIT 라이선스 하에 출시되어, 국경 없는 기술적 접근을 제공합니다.
장기 코딩 벤치마크 성능
GLM-5.2는 강력한 장기 수행 능력을 입증하며, 3개의 벤치마크에서 가장 높은 순위를 기록한 오픈 소스 모델로 자리매김했습니다.
FrontierSWE에서 GLM-5.2는 Opus 4.8에 불과 1% 뒤처지며, GPT-5.5를 1% 차이로 앞서고, Opus 4.7보다 11% 뛰어난 성능을 보입니다.
PostTrainBench에서 GLM-5.2는 Opus 4.7와 GPT-5.5를 모두 능가하며, Opus 4.8에 이어 2위를 차지했습니다.
SWE-Marathon에서 GLM-5.2는 Opus 4.8에 13% 뒤처지지만, Opus 시리즈 다음으로 2위를 유지합니다.
세 가지 벤치마크 모두에서 GLM-5.2는 가장 높은 순위의 오픈 소스 모델로, 1M 컨텍스트가 실제 장기 수행 능력으로 이어진다는 것을 보여줍니다.
표준 코딩 벤치마크 성능
GLM-5.2는 표준 코딩 벤치마크에서 강력한 결과를 달성하며, 이전 모델보다 눈에 띄게 향상되었고 폐쇄형 프런티어 모델과의 격차를 좁혔습니다.
Terminal‑Bench 2.1에서 GLM-5.2는 81.0점을 기록하여 GLM-5.1의 63.5점보다 높으며, Claude Opus 4.8의 85.0점에 근접하고 Gemini 3.1 Pro보다 앞서 있습니다.
SWE‑bench Pro에서 GLM-5.2는 62.1점을 기록하여 GLM-5.1의 58.4점보다 높은 점수를 얻었습니다.
노력 수준 제어
GLM-5.2의 노력 수준 제어는 사용자가 모델 역량과 실행 속도 및 계산 비용 사이의 균형을 명시적으로 맞출 수 있게 합니다.
유사한 토큰 예산에서 GLM-5.2는 GLM-5.1보다 실질적으로 더 강력한 에이전트 코딩 성능을 제공하며, 역량은 대략 Claude Opus 4.7와 Claude Opus 4.8 사이에 위치합니다.
Max 노력 수준은 까다로운 작업에 추가 계산을 허용하여 코딩 역량을 더욱 확장합니다.
이 설계는 사용자가 다양한 시나리오에 가장 적합한 추론 모드를 선택할 수 있는 유연성을 제공합니다.
1M 컨텍스트를 위한 아키텍처
GLM-5.2의 아키텍처 변경은 매우 긴 시퀀스의 효율적인 처리를 가능하게 합니다.
DSA를 위한 IndexShare
GLM-5.2에서는 4개의 transformer 레이어마다 가벼운 인덱서가 공유됩니다. 이 인덱서는 첫 번째 레이어에 배치되어 다음 3개의 레이어에서 재사용되며, 이를 통해 레이어의 4분의 3에서 인덱서 dot product 및 topk 연산 계산을 줄입니다.
GLM-5.2는 128K 시퀀스 길이를 사용하는 mid‑training부터 IndexShare를 사용하여 학습되었으며, 더 적은 계산으로도 긴 컨텍스트 벤치마크에서 GLM-5.1보다 뛰어난 성능을 보입니다.
IndexShare 및 KVShare를 적용한 MTP
GLM-5.2의 MTP 레이어는 비용을 줄이기 위해 IndexShare를 적용하고, 학습-추론 간의 불일치를 제거하기 위해 KV cache 재사용을 사용하여 투기적 디코딩을 위해 개선되었습니다.
Ablation 연구에 따르면 IndexShare + KV Share를 추가하면 수락 길이가 4.56에서 5.10으로 증가하고, rejection sampling을 추가하면 5.29로 증가하며, end‑to‑end TV loss를 추가하면 5.47로 증가하여 베이스라인 대비 20% 증가합니다.
1M 컨텍스트 길이의 효율적인 서빙
GLM-5.2는 최대 컨텍스트 길이를 200K에서 1M 토큰으로 확장하여, 추론 병목 현상을 계산에서 KV‑cache 용량, 긴 컨텍스트 커널 오버헤드 및 CPU 측 오버헤드로 이동시켰습니다.
이를 해결하기 위해 추론 엔진은 더 세밀한 메모리 관리(LayerSplit 기반), 캐시 전송과 조율되는 커널 최적화, 그리고 파이프라인 버블을 줄이기 위한 CPU 측 캐시 관리 및 요청 스케줄링을 통해 최적화되었습니다.
그 결과, GLM-5.2는 컨텍스트 길이가 증가함에 따라 점점 더 큰 처리량 이점을 달성하며, 긴 컨텍스트 추론 시나리오에서 더 강력한 확장성을 보여줍니다.
Agentic RL을 위한 slime
slime 프레임워크는 GLM-5.2의 agentic RL 사후 학습을 위한 통합 인프라 레이어 역할을 하며, 다양한 학습 및 작업 조직 모드를 지원합니다.
사후 학습 과정에서 slime는 병렬 OPD 학습을 수행하는 데 사용되어 10개 이상의 전문가 모델을 최종 모델로 효율적으로 병합했으며, 전체 OPD 학습에는 약 이틀이 소요되었습니다.
slime은 추론 시스템에 대해 매우 개방적이고 유연한 인터페이스를 제공하여, 학습 측에서 다양한 형태의 추론 서비스에 연결하고 다양한 병렬화 전략, 라우팅 정책, PD 분리 설정 및 배포 패턴에 적응할 수 있도록 합니다.
RL rollout 중에 축적된 구성 경험, 스케줄링 전략 및 최적화 경로는 프로덕션 서빙에서 재사용될 수 있어, 사후 학습에서 배포로 이어지는 직접적인 경로를 생성합니다.
유연한 학습-추론 리소스 조직 및 KV‑cache FP8과 결합하여, slime는 GLM-5.2의 대규모 agentic RL 학습을 위한 핵심 인프라 지원을 제공하며 시스템 효율성, rollout 처리량 및 대규모 추론 동시성을 향상시킵니다.
Anti‑hacking을 적용한 장기 과업용 RL
GLM-5.2의 장기 과업용 RL은 그룹 단위 최적화에서 개별 rollout으로부터 학습하는 critic 기반 PPO 공식으로 이동하며, critic을 사용하여 토큰 수준의 이점을 추정합니다.
이 단일-rollout 공식은 프롬프트에 의해 생성된 트레이스의 수나 길이에 제한을 두지 않으므로 자연스럽게 압축(compaction)을 수용할 수 있습니다.
코딩 에이전트의 보상 해킹(reward hacking)에 대응하기 위해 GLM-5.2는 두 단계의 anti‑hack 모듈을 도입합니다. 높은 재현율(recall)을 위해 잠재적 해킹을 플래그를 지정하는 규칙 기반 필터와, 높은 정밀도(precision)를 유지하기 위해 의도를 확인하는 LLM 판독기(judge)가 뒤따릅니다.
시스템은 각 단계에서 도구 호출을 모니터링합니다. 해킹이 감지되면 호출이 차단되고 더미 정보가 반환되어, 유효하지 않은 동작이 처리된 후 rollout이 계속될 수 있도록 합니다.
이 온라인 가드는 rollout이 갑자기 중단될 때 발생할 수 있는 학습 불안정성 및 모델 붕괴를 방지합니다.
GLM-5.2 시작하기
GLM Coding Plan으로 GLM-5.2 사용하기
GLM-5.2는 ZCode, Claude Code, OpenCode와 같은 인기 있는 코딩 에이전트에서 사용할 수 있습니다.
GLM Coding Plan 구독자의 경우, 모델이 이미 배포되어 있습니다. 사용자는 모델 이름을 "GLM-5.2"(또는 1M 컨텍스트를 활성화하려면 Claude Code에서 "GLM-5.2[1m]")로 설정하여 활성화할 수 있습니다.
작업에 따라 서로 다른 사고 노력 수준(High 또는 Max)을 선택할 수 있습니다.
GLM-5.2는 피크 시간대에는 3배, 비피크 시간대에는 2배의 쿼터를 소비합니다. 9월 말까지 한시적 프로모션으로 비피크 시간대 사용량은 1배로 청구됩니다.
피크 시간대는 매일 14:00–18:00 UTC+8 (베이징 시간)으로 정의됩니다.
GLM-5.2로 구동되는 데스크톱 에이전트인 ZCode는 장기 과업을 위한 /goal 명령, SSH 원격 개발 및 모바일 제어를 제공합니다.
특별 혜택: ZCode 내의 Coding Plan을 통해 GLM-5.2를 사용하면 6월 30일까지 1.5배의 유효 쿼터가 제공됩니다.
사용자는 https://z.ai/subscribe 에서 구축을 시작할 수 있습니다.
Z.ai에서 GLM-5.2와 채팅하기
GLM-5.2는 이제 https://chat.z.ai/ 에서 채팅이 가능합니다.
로컬에서 GLM-5.2 서빙하기
모델 가중치는 Hugging Face의 https://huggingface.co/zai-org/GLM-5.2 및 ModelScope의 https://modelscope.cn/models/ZhipuAI/GLM-5.2에서 공개적으로 사용할 수 있습니다.
로컬 배포를 위해 GLM-5.2는 transformers, vLLM, SGLang, xLLM, ktransformers를 포함한 추론 프레임워크를 지원합니다.