GLM-5.2 性能分析

GLM-5.2 由 Artificial Analysis 进行分析,以确定其智能水平、性能和定价效率。评估重点在于模型处理智能体化现实世界工作任务、编程和终端使用的能力,同时衡量智能与运营成本之间的权衡。

智能与智能体能力

GLM-5.2 使用 Artificial Analysis Intelligence Index v4.1 进行衡量,该指数包含九项不同的评估,包括 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR。

关键智能指标包括:

  • Agentic Work Tasks:通过 (Elo-500)/2000 进行衡量。
  • Agentic Coding:评估模型使用终端并执行编程任务的能力。
  • Agentic Tool Use:评估模型与外部工具集成并利用它们的能力。

性能与延迟指标

Artificial Analysis 通过几个关键性能指标评估 GLM-5.2 的速度和响应能力:

  • Output Speed:以每秒 token 数衡量,代表接收到第一个 chunk 后的生成速度。
  • Time to First Token (TTFT):API 请求与第一个回答 token 之间的延迟,这包括推理模型的“思考”时间。
  • End-to-End Response Time:输出 500 个 token 所需的总时间,结合了输入时间、思考时间(针对推理模型)和生成速度。
  • Time per Intelligence Index Task:每个任务的加权平均墙钟时间(以分钟为单位),不包括 TTFT 和执行时间。

成本与定价结构

通过将每个 Intelligence Index 任务的成本与智能分数进行比较,来评估 GLM-5.2 的经济效率。这是基于输入、cache hit、cache write 和 reasoning tokens 的混合费率计算的。

  • Pricing Components:模型的定价按输入 tokens、输出 tokens 和 cache hit 价格(每百万 tokens 的 USD)进行细分。
  • Cost to Run Index:在 Artificial Analysis Intelligence Index 中执行所有评估的总 USD 成本。
  • Token Efficiency:在 Intelligence Index 中完成单个任务所使用的输出 tokens 的加权平均数。

上下文窗口与模型架构

GLM-5.2 支持的上下文窗口决定了其在检索增强生成 (RAG) 工作流中的能力,这些工作流需要处理大量数据进行推理和信息检索。

对于模型的开源权重版本,Artificial Analysis 会追踪总参数量(可训练权重的总数)和活跃参数量(每次推理前向传播期间执行的参数),这对于混合专家 (MoE) 架构特别相关,因为其活跃参数少于总参数量。

Sources