GLM-5.2 性能分析
GLM-5.2 由 Artificial Analysis 進行分析,以確定其智能、性能和定價效率。評估重點在於模型處理代理型(agentic)真實世界工作任務、編碼和終端機使用的能力,同時衡量智能與營運成本之間的權衡。
智能與代理能力
GLM-5.2 使用 Artificial Analysis Intelligence Index v4.1 進行衡量,該指數包含九項不同的評估,包括 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR。
關鍵智能指標包括:
- 代理型工作任務:透過 (Elo-500)/2000 進行衡量。
- 代理型編碼:評估模型使用終端機和執行編碼任務的能力。
- 代理型工具使用:評估模型與外部工具整合及利用的能力。
性能與延遲指標
Artificial Analysis 透過幾項關鍵性能指標來評估 GLM-5.2 的速度和響應能力:
- 輸出速度:以每秒 token 數衡量,代表收到第一個區塊(chunk)後的生成速度。
- 首字延遲 (TTFT):API 請求與第一個回答 token 之間的延遲,這包括了推理模型的「思考」時間。
- 端到端響應時間:輸出 500 個 token 所需的總時間,結合了輸入時間、思考時間(針對推理模型)和生成速度。
- 每個智能指數任務的時間:每個任務的加權平均牆鐘時間(以分鐘計),不包括 TTFT 和執行時間。
成本與定價結構
GLM-5.2 的經濟效率是透過將每個 Intelligence Index 任務的成本與其智能分數進行比較來評估的。這是基於輸入、快取命中(cache hit)、快取寫入(cache write)和推理 token 的混合費率計算的。
- 定價組成部分:模型的定價按輸入 token、輸出 token 和快取命中價格(每百萬 token 的 USD)進行細分。
- 運行指數成本:在 Artificial Analysis Intelligence Index 中執行所有評估所需的總 USD 成本。
- Token 效率:在 Intelligence Index 中完成單個任務所使用的輸出 token 數的加權平均值。
上下文窗口與模型架構
GLM-5.2 支持的上下文窗口決定了其在檢索增強生成(RAG)工作流中的容量,這類工作流需要處理大量數據進行推理和信息檢索。
對於模型的開源權重版本,Artificial Analysis 會追蹤總參數(可訓練權重的總數)和活動參數(每次推理前向傳播期間執行的參數),這對於混合專家(MoE)架構特別相關,因為在 MoE 架構中,活動參數少於總參數。