GLM-5.2 發佈:Artificial Analysis 指數上的全新領先開源權重模型

Z ai 的 GLM-5.2 現在是 Artificial Analysis Intelligence Index 上的領先開源權重模型,得分為 51。這一排名使其超越了其他頂尖的開源權重模型,包括 MiniMax-M3 (44)、DeepSeek V4 Pro max (44) 和 Kimi K2.6 (43)。值得注意的是,GLM-5.2 位處於「智能 vs. 每任務成本」的 Pareto frontier,在同等智能水平的模型中,提供了最低的每任務成本。

基準測試與智能增長

GLM-5.2 相比其前身 GLM-5.1 有顯著的改進,特別是在科學推理和智能體(agentic)能力方面。在保持相同模型規模(總計 744B / 40B 激活參數)的情況下,它在 Intelligence Index v4.1 上提升了 11 分。

科學推理與通用智能

GLM-5.2 在幾項關鍵評估中取得了實質性的增長:

  • CritPt: 提升了 16 分,達到 21%
  • HLE: 提升了 12 分,達到 40%
  • AA-LCR: 提升了 9 分,達到 71%
  • tau3 banking: 提升了 15 分,達到 27%
  • SciCode: 提升了 7 分,達到 50%
  • TerminalBench v2.1: 提升了 16 分,達到 78%
  • GPQA Diamond: 提升了 3 分,達到 89%

智能體性能 (GDPval-AA v2)

在衡量真實世界智能體性能的 GDPval-AA v2 指標上,GLM-5.2 得分為 1524。這超越了 MiniMax-M3 (1418) 和 DeepSeek V4 Pro max (1328),實際上使其與專有模型 GPT-5.5 (xhigh reasoning) 的 1514 分處於同一水平。

幻覺與全知性

GLM-5.2 在 AA-Omniscience Index 上得分為 4,是 GLM-5.1 (2) 的兩倍。這一進步歸功於更高的準確度 (25.1% vs 24.2%) 和更低的幻覺率 (28.1% vs 29.4%)。

技術規格與可用性

GLM-5.2 以 MIT license 發佈,並具有顯著擴大的上下文窗口。

  • 模型架構: 744B 總參數 / 40B 激活參數。
  • 上下文窗口: 1M tokens (從 GLM-5.1 的 200K 增加而來)。
  • 定價: 每 1M input tokens 為 $1.4,每 1M output tokens 為 $4.4,以及每 1M cache hit tokens 為 $0.26。
  • 可用性: 可透過 Z ai 的第一方 API 以及包括 DeepInfra, Novita, Nebius, Parasail, Siliconflow, GMI Cloud, Baseten, 和 Fireworks 在內的第三方提供商獲取。

效率與權衡

儘管智能增長,GLM-5.2 與同類模型相比表現出較低的 token 效率。該模型在每個 Intelligence Index 任務中平均使用 43k output tokens (其中 37k 為推理 tokens),而 GLM-5.1 為 26k,MiniMax-M3 為 24k。

成本 vs. 性能

GLM-5.2 的每任務成本約為 $0.46。雖然這比 DeepSeek V4 Pro max ($0.05) 或 MiniMax-M3 ($0.18) 高,但它被定位為在 Pareto frontier 上其特定智能水平下最具成本效益的選擇。

社群洞察與分析

關於 GLM-5.2 的技術討論突顯了基準測試性能與真實世界效率之間的差距。

推理冗長性

用戶指出,該模型在思考過程中可能過於冗長。一位用戶報告說,一個簡單的 Nim 語言的數學評估器任務在寫入第一個文件之前,就消耗了超過 15 分鐘的推理和 45k tokens,並指出與之相比,「GPT 5.5 是極其推理效率高的」。

競爭地位

雖然一些用戶將 GLM-5.2 於開源權重模型中視為巨大的勝利——將其品質與 Opus 4.7 進行比較,且成本僅為其一小部分——但其他人則認為,這些模型與絕對的前沿技術仍存在差距。

"Compared to GPT5.5 medium GLM5.1xhigh is twice the cost and half the intelligence... if you want to be near the frontier everyone needs to be honest about the fact that we're only talking about Opus, Fable, GPT5.5."

其他用戶建議使用混合工作流,使用 GLM-5.2 進行生成,並使用 GPT-5.5 進行審核與除錯,作為高階專有模型方案的成本效益替代方案。

Sources