GLM-5.2 출시: Artificial Analysis Index의 새로운 선두 오픈 웨이트 모델

Z ai의 GLM-5.2는 Artificial Analysis Intelligence Index에서 51점을 기록하며 선두를 차지했습니다. 이 순위는 MiniMax-M3 (44), DeepSeek V4 Pro max (44), 그리고 Kimi K2.6 (43)을 포함한 다른 주요 오픈 웨이트 모델들을 앞서는 수치입니다. 특히, GLM-5.2는 지능 대 작업당 비용의 Pareto frontier에 위치하여, 특정 지능 수준 내에서 가장 낮은 작업당 비용을 제공합니다.

벤치마크 및 지능 향상

GLM-5.2는 이전 모델인 GLM-5.1에 비해, 특히 과학적 추론 및 에이전트 기능에서 상당한 개선을 보여줍니다. 동일한 모델 크기(총 744B / 활성 40B 파라미터)를 유지하면서도 Intelligence Index v4.1에서 11점을 획득했습니다.

과학적 추론 및 일반 지능

GLM-5.2는 여러 핵심 평가 항목에서 상당한 이득을 보였습니다:

  • CritPt: 16점 상승하여 21%
  • HLE: 12점 상승하여 40%
  • AA-LCR: 9점 상승하여 71%
  • tau3 banking: 15점 상승하여 27%
  • SciCode: 7점 상승하여 50%
  • TerminalBench v2.1: 16점 상승하여 78%
  • GPQA Diamond: 3점 상승하여 89%

에이전트 성능 (GDPval-AA v2)

실제 세계의 에이전트 성능을 측정하는 GDPval-AA v2 지표에서 GLM-5.2는 1524점을 기록했습니다. 이는 MiniMax-M3 (1418)와 DeepSeek V4 Pro max (1328)를 능가하며, 사실상 1514점을 기록한 독점 모델인 GPT-5.5 (xhigh reasoning)와 대등한 수준입니다.

환각 및 전지성

GLM-5.2는 AA-Omniscience Index에서 4점을 기록하여, GLM-5.1 (2)의 두 배에 달하는 점수를 얻었습니다. 이러한 개선은 더 높은 정확도 (25.1% vs 24.2%)와 감소된 환각률 (28.1% vs 29.4%) 덕분입니다.

기술 사양 및 가용성

GLM-5.2는 MIT license 하에 출시되었으며, 대폭 확장된 컨텍스트 윈도우를 특징으로 합니다.

  • 모델 아키텍처: 총 744B 파라미터 / 활성 40B 파라미터.
  • 컨텍스트 윈도우: 1M tokens (GLM-5.1의 200K에서 증가).
  • 가격: 입력 1M tokens당 $1.4, 출력 1M tokens당 $4.4, 캐시 히트 1M tokens당 $0.26.
  • 가용성: Z ai의 자체 API 및 DeepInfra, Novita, Nebius, Parasail, Siliconflow, GMI Cloud, Baseten, Fireworks를 포함한 제3자 제공업체를 통해 이용 가능합니다.

효율성 및 트레이드오프

지능 향상에도 불구하고, GLM-5.2는 동급 모델들과 비교했을 때 토큰 효율성이 낮습니다. 이 모델은 Intelligence Index 작업당 평균 43k output tokens를 사용하며 (이 중 37k는 reasoning tokens), 이는 GLM-5.1의 26k 및 MiniMax-M3의 24k와 비교됩니다.

비용 vs. 성능

GLM-5.2의 작업당 비용은 약 $0.46입니다. 이는 DeepSeek V4 Pro max ($0.05) 또는 MiniMax-M3 ($0.18)보다 높지만, Pareto frontier 상에서 특정 지능 수준에 대해 가장 비용 효율적인 옵션으로 자리매김하고 있습니다.

커뮤니티 인사이트 및 분석

기술적 논의에는 벤치마크 성능과 실제 세계의 효율성 사이의 간극극이 강조됩니다.

추론 Verbosity (장황함)

사용자들은 이 모델이 사고 과정에서 지나치게 장황할 수 있다고 지적합니다. 한 사용자는 Nim 언어로 작성된 간단한 수학 평가기 작업을 수행할 때 첫 번째 파일이 작성되기 전까지 15분 이상의 추론과 45k tokens를 사용했다고 보고하며, 이에 비해

Sources