GLM-5.2 출시: Artificial Analysis Index의 새로운 선두 오픈 웨이트 모델
Z ai의 GLM-5.2는 Artificial Analysis Intelligence Index에서 51점을 기록하며 선두를 차지했습니다. 이 순위는 MiniMax-M3 (44), DeepSeek V4 Pro max (44), 그리고 Kimi K2.6 (43)을 포함한 다른 주요 오픈 웨이트 모델들을 앞서는 수치입니다. 특히, GLM-5.2는 지능 대 작업당 비용의 Pareto frontier에 위치하여, 특정 지능 수준 내에서 가장 낮은 작업당 비용을 제공합니다.
벤치마크 및 지능 향상
GLM-5.2는 이전 모델인 GLM-5.1에 비해, 특히 과학적 추론 및 에이전트 기능에서 상당한 개선을 보여줍니다. 동일한 모델 크기(총 744B / 활성 40B 파라미터)를 유지하면서도 Intelligence Index v4.1에서 11점을 획득했습니다.
과학적 추론 및 일반 지능
GLM-5.2는 여러 핵심 평가 항목에서 상당한 이득을 보였습니다:
- CritPt: 16점 상승하여 21%
- HLE: 12점 상승하여 40%
- AA-LCR: 9점 상승하여 71%
- tau3 banking: 15점 상승하여 27%
- SciCode: 7점 상승하여 50%
- TerminalBench v2.1: 16점 상승하여 78%
- GPQA Diamond: 3점 상승하여 89%
에이전트 성능 (GDPval-AA v2)
실제 세계의 에이전트 성능을 측정하는 GDPval-AA v2 지표에서 GLM-5.2는 1524점을 기록했습니다. 이는 MiniMax-M3 (1418)와 DeepSeek V4 Pro max (1328)를 능가하며, 사실상 1514점을 기록한 독점 모델인 GPT-5.5 (xhigh reasoning)와 대등한 수준입니다.
환각 및 전지성
GLM-5.2는 AA-Omniscience Index에서 4점을 기록하여, GLM-5.1 (2)의 두 배에 달하는 점수를 얻었습니다. 이러한 개선은 더 높은 정확도 (25.1% vs 24.2%)와 감소된 환각률 (28.1% vs 29.4%) 덕분입니다.
기술 사양 및 가용성
GLM-5.2는 MIT license 하에 출시되었으며, 대폭 확장된 컨텍스트 윈도우를 특징으로 합니다.
- 모델 아키텍처: 총 744B 파라미터 / 활성 40B 파라미터.
- 컨텍스트 윈도우: 1M tokens (GLM-5.1의 200K에서 증가).
- 가격: 입력 1M tokens당 $1.4, 출력 1M tokens당 $4.4, 캐시 히트 1M tokens당 $0.26.
- 가용성: Z ai의 자체 API 및 DeepInfra, Novita, Nebius, Parasail, Siliconflow, GMI Cloud, Baseten, Fireworks를 포함한 제3자 제공업체를 통해 이용 가능합니다.
효율성 및 트레이드오프
지능 향상에도 불구하고, GLM-5.2는 동급 모델들과 비교했을 때 토큰 효율성이 낮습니다. 이 모델은 Intelligence Index 작업당 평균 43k output tokens를 사용하며 (이 중 37k는 reasoning tokens), 이는 GLM-5.1의 26k 및 MiniMax-M3의 24k와 비교됩니다.
비용 vs. 성능
GLM-5.2의 작업당 비용은 약 $0.46입니다. 이는 DeepSeek V4 Pro max ($0.05) 또는 MiniMax-M3 ($0.18)보다 높지만, Pareto frontier 상에서 특정 지능 수준에 대해 가장 비용 효율적인 옵션으로 자리매김하고 있습니다.
커뮤니티 인사이트 및 분석
기술적 논의에는 벤치마크 성능과 실제 세계의 효율성 사이의 간극극이 강조됩니다.
추론 Verbosity (장황함)
사용자들은 이 모델이 사고 과정에서 지나치게 장황할 수 있다고 지적합니다. 한 사용자는 Nim 언어로 작성된 간단한 수학 평가기 작업을 수행할 때 첫 번째 파일이 작성되기 전까지 15분 이상의 추론과 45k tokens를 사용했다고 보고하며, 이에 비해