GLM-5.2 성능 분석
GLM-5.2는 Artificial Analysis에 의해 지능, 성능 및 가격 효율성을 결정하기 위해 분석되었습니다. 평가는 모델의 에이전트 기반 실제 작업 처리, 코딩 및 터미널 사용 능력을 중심으로 하며, 지능과 운영 비용 간의 트레이드오프를 측정합니다.
지능 및 에이전트 능력
GLM-5.2는 GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR을 포함한 9가지의 뚜렷한 평가를 통합한 Artificial Analysis Intelligence Index v4.1을 사용하여 측정됩니다.
주요 지능 지표는 다음과 같습니다:
- Agentic Work Tasks: (Elo-500)/2000을 통해 측정됩니다.
- Agentic Coding: 터미널을 사용하고 코딩 작업을 수행하는 모델의 능력을 평가합니다.
- Agentic Tool Use: 외부 도구와 통합하고 활용하는 모델의 능력을 평가합니다.
성능 및 지연 시간 지표
Artificial Analysis는 다음과 같은 몇 가지 주요 성능 지표를 통해 GLM-5.2의 속도와 응답성을 평가합니다:
- Output Speed: 첫 번째 청크를 받은 후의 생성 속도를 나타내는 초당 토큰 수로 측정됩니다.
- Time to First Token (TTFT): API 요청과 첫 번째 답변 토큰 사이의 지연 시간으로, 추론 모델의 경우 "thinking" 시간을 포함합니다.
- End-to-End Response Time: 입력 시간, thinking 시간(추론 모델의 경우), 생성 속도를 결합하여 500개 토큰을 출력하는 데 필요한 총 시간입니다.
- Time per Intelligence Index Task: TTFT와 실행 시간을 제외한 작업당 가중 평균 실제 시간(분 단위)입니다.
비용 및 가격 구조
GLM-5.2의 경제적 효율성은 Intelligence Index 작업당 비용을 지능 점수와 비교하여 평가됩니다. 이는 입력, 캐시 히트, 캐시 쓰기 및 추론 토큰의 혼합 요율을 기반으로 계산됩니다.
- Pricing Components: 모델의 가격은 입력 토큰, 출력 토큰 및 캐시 히트 가격(백만 토큰당 USD)으로 세분화됩니다.
- Cost to Run Index: Artificial Analysis Intelligence Index 내의 모든 평가를 실행하는 데 드는 총 USD 비용입니다.
- Token Efficiency: Intelligence Index에서 단일 작업을 완료하는 데 사용되는 출력 토큰의 가중 평균 수입니다.
컨텍스트 창 및 모델 아키텍처
GLM-5.2는 Retrieval Augmented Generation (RAG) 워크플로우를 결정하는 컨텍스트 창을 지원하며, 이는 추론 및 정보 검색을 위해 대량의 데이터를 처리해야 합니다.
모델의 open-weights 버전의 경우, Artificial Analysis는 총 파라미터(학습 가능한 가중치의 총 수)와 활성 파라미터(각 추론 순전파 단계에서 실행되는 파라미터)를 모두 추적합니다. 이는 활성 파라미터가 총 파라미터보다 적은 Mixture of Experts (MoE) 아키텍처에서 특히 관련이 있습니다.