GLM-5.2 发布:Artificial Analysis 指数上的全新领先开源权重模型
Z ai 的 GLM-5.2 目前在 Artificial Analysis Intelligence Index 上排名第一,得分为 51 分。这一排名使其超越了其他顶尖的开源权重模型,包括 MiniMax-M3 (44)、DeepSeek V4 Pro max (44) 和 Kimi K2.6 (43)。值得注意的是,GLM-5.2 处于“智能 vs. 单任务成本”的帕累托前沿 (Pareto frontier),在同等智能水平的模型中,它提供了最低的任务成本。
基准测试与智能提升
GLM-5.2 相比其前身 GLM-5.1 有显著提升,特别是在科学推理和智能体 (agentic) 能力方面。在保持相同模型规模(总参数 744B / 激活参数 40B)的情况下,它在 Intelligence Index v4.1 上提升了 11 分。
科学推理与通用智能
GLM-5.2 在多项关键评估中实现了大幅增长:
- CritPt: 提升了 16 分,达到 21%
- HLE: 提升了 12 分,达到 40%
- AA-LCR: 提升了 9 分,达到 71%
- tau3 banking: 提升了 15 分,达到 27%
- SciCode: 提升了 7 分,达到 50%
- TerminalBench v2.1: 提升了 16 分,达到 78%
- GPQA Diamond: 提升了 3 分,达到 89%
智能体性能 (GDPval-AA v2)
在衡量真实世界智能体性能的 GDPval-AA v2 指标上,GLM-5.2 得分为 1524。这优于 MiniMax-M3 (1418) 和 DeepSeek V4 Pro max (1328),实际上使其达到了与闭源模型 GPT-5.5 (xhigh reasoning) 1514 分的同等水平。
幻觉与全知性
GLM-5.2 在 AA-Omniscience Index 上得分为 4,是 GLM-5.1 (2) 的两倍。这一提升归功于更高的准确率 (25.1% vs 24.2%) 和更低的幻觉率 (28.1% vs 29.4%)。
技术规格与可用性
GLM-5.2 基于 MIT 许可证发布,并拥有显著扩大的上下文窗口。
- 模型架构: 总参数 744B / 激活参数 40B。
- 上下文窗口: 1M tokens (较 GLM-5.1 的 200K 有所增加)。
- 定价: 每 1M 输入 tokens 为 $1.4,每 1M 输出 tokens 为 $4.4,每 1M 缓存命中 tokens 为 $0.26。
- 可用性: 可通过 Z ai 的第一方 API 以及包括 DeepInfra, Novita, Nebius, Parasail, Siliconflow, GMI Cloud, Baseten, 和 Fireworks 在内的第三方提供商获取。
效率与权衡
尽管智能水平有所提升,但与同行相比,GLM-5.2 的 token 效率较低。该模型在每个 Intelligence Index 任务中平均使用 43k 输出 tokens (其中 37k 为推理 tokens),而 GLM-5.1 为 26k,MiniMax-M3 为 24k。
成本 vs. 性能
GLM-5.2 的单任务成本约为 $0.46。虽然这比 DeepSeek V4 Pro max ($0.05) 或 MiniMax-M3 ($0.18) 高,但在帕累托前沿上,它是同等智能水平下最具性价比的选择。
社区洞察与分析
关于 GLM-5.2 的技术讨论突显了其在基准测试性能与真实世界效率之间的分歧。
推理冗余度
用户指出,该模型在思考过程中可能过于冗余。一位用户报告称,在 Nim 语言进行的一个简单的数学评估器任务中,在写入第一个文件之前,模型花费了超过 15 分钟的推理和 45k tokens,并指出相比之下 "GPT 5.5 is extremely reasoning efficient"。
竞争定位
虽然一些用户认为 GLM-5.2 是开源权重模型的重大胜利——将其质量与 Opus 4.7 进行比较,且成本仅为一小部分——但也有人认为这些模型与绝对前沿水平之间仍存在差距。
"Compared to GPT5.5 medium GLP5.1xhigh is twice the cost and half the intelligence... if you want to be near the frontier, everyone needs to be honest about the fact that we're only talking about Opus, Fable, GPT5.5."
其他用户建议采用混合工作流,即使用 GLM-5.2 进行生成,并使用 GPT-5.5 进行评审和调试,作为高阶闭源模型方案的高性价比替代方案。