zai-org/GLM-5
GLM-5: From Vibe Coding to Agentic Engineering
GLM-5 시리즈 – Z.ai의 대규모, 장기 컨텍스트 LLM
개요 – Z.ai/GLM 팀이 출시한 오픈 웨이트 대규모 언어 모델 제품군(GLM-5, GLM-5.1, GLM-5.2, GLM-5.3 및 효율성 중심의 GLM-5.3-Flash)입니다. 이 모델들은 코딩, 사이버 보안, 그리고 장기적인 에이전트 작업을 위해 구축되었으며, 최대 100만 토큰 컨텍스트를 지원합니다.
중요성 – 이전 GLM-4.x 라인과 비교하여, GLM-5 모델은 파라미터 수를 두 배로 늘렸으며(총합 최대 744B, 활성 40B), 사전 학습 데이터를 28.5T 토큰으로 늘렸습니다. 팀은 다양한 공개 벤치마크(Terminal-Bench, SWE-Bench, CyberGym, Vending Bench 등)에서 최첨단 결과를 보고하였으며, 추론론, 코딩, 그리고 장기 계획 능력을 위한 최고의 오픈 소스 성능을 주장합니다.
주요 기술적 하이라이트
장기 컨텍스트 능력 – GLM-5.2는 확실한 1M 토큰 컨텍스트 창을 도입하여, 매우 긴 문서나 다단계 도구 사용 작업을 지속적으로 수행할 수 있습니다.
하이브리드 Sparse/Linear Attention – GLM-5.3-Flash는 희소(sparse)와 밀집(dense) 어텐션을 혼합한 새로운 아키텍처를 사용하여, 정밀한 장거리 추론을 유지하면서도 서빙 비용을를 낮춥니다.
IndexShare – 4개의 희소 어텐션 레이어에 걸쳐 공유 인덱서를 사용하여 1M 컨텍스트 길이에서 FLOPs를 약 2.9배 감소시킵니다.
Manifold-Constrained Hyper-Connections (mHC) – Flash 변형 모델에서 스케일링 효율성을 개선하기 위해 사용됩니다.
Reasoning-effort control – 새로운 모델은
reasoning_effort파라미터(low,high,max)와clear_thinking플래그를 노출하여 지연 시간과 성능 사이의 트레이드오프를 조절할 수 있습니다.강화 학습 인프라 – slime 라이브러리(비동기 RL)가 미세 조정 및 사후 학습을 위해 제공됩니다.
모델 크기 & 포맷
| Model | Parameters (total / active) | Precision options | Where to download |
|---|---|---|---|
| GLM-5.3 | 744B / 40B | FP8, BF16 | Hugging Face, ModelScope |
| GLM-5.3-Flash | 320B / 18B | FP8, BF16 | Hugging Face, ModelScope |
| GLM-5.2 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
| GLM-5.1 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
| GLM-5.2 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
| GLM-5 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
로컬에서 모델 실행하기 – 리포지토리는 GLM-5 시리즈를 위한 레시피가 이미 준비된 여러 인퍼런스 백엔드를 나열합니다:
- SGLang – 전용 cookbook을 통한 빠른 서빙. | vLLM – 고처리량 인퍼런스; 각 모델에 대한 레시피가 제공됩니다.
- Transformers (🤗) – 공식 모델 카드와 문서.
- KTransformers – 커널 수준의 가속 튜토리얼.
- Unsloth – 경량화된 배포 가이드.
- Ascend NPU – vLLM-Ascend, xLLM 등을 통한 지원.
미세 조정 – 모델은 다음을 통해 추가적으로 적응할 수 있습니다:
- slime (팀의 비동기 RL 프레임워크)를 통한 강화 학습 기반 미세 조정.
- ms-swift를 통한 지도 학습 미세 조정 (SFT), PPO, 및 GRPO.
커뮤니티 & 리소스
- 공식 Discord와 WeChat 그룹을 통한 사용자 지원.
- GLM-5.3, GLM-5.3-Flash, 및 GLM-5.2에 대한 블로그 포스트.
- arXiv 기술 보고서 (arXiv:2602.15763)에 아키텍처와 학습 데이터를 상세히 기술함.
인용 – 연구에 GLM-5 모델을 사용한다면, 제공된 arXiv 기술 보고서를 인용하십시오 (README에 full BibTeX 포함).
위의 모든 정보는 리포지토리의 README에서 직접 가져온 것입니다; 추가적인 클레임은 추가되지 않았습니다.
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch