GLM-5.2 パフォーマンス分析

GLM-5.2は、Artificial Analysisによって、その知能、パフォーマンス、および価格効率を判断するために分析されています。この評価は、エージェント的な実世界のワークタスク、コーディング、およびターミナル使用におけるモデルの能力に焦点を当て、知能と運用コストの間のトレードオフを測定します。

知能とエージェント能力

GLM-5.2は、Artificial Analysis Intelligence Index v4.1を使用して測定されています。これには、GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、およびAA-LCRを含む9つの異なる評価が含まれます。

主要な知能指標には以下が含まれます:

  • Agentic Work Tasks: (Elo-500)/2000を介して測定されます。
  • Agentic Coding: ターミナルを使用し、コーディングタスクを実行するモデルの能力の評価。
  • Agentic Tool Use: 外部ツールと統合し、活用するモデルの能力の評価。

パフォーマンスとレイテンシ指標

Artificial Analysisは、いくつかの主要なパフォーマンス指標を通じて、GLM-5.2の速度と応答性を評価します:

  • Output Speed: 最初のチャンクを受信した後の生成速度を表す、1秒あたりのトークン数で測定されます。
  • Time to First Token (TTFT): APIリクエストと最初の回答トークンの間のレイテンシであり、これには推論モデルの「思考」時間が含まれます。
  • End-to-End Response Time: 入力時間、思考時間(推論モデルの場合)、および生成速度を組み合わせた、500トークンを出力するのに必要な合計時間。
  • Time per Intelligence Index Task: TTFTと実行時間を除いた、タスクあたりの加重平均実時間(分単位)。

コストと価格構造

GLM-5.2の経済的効率は、Intelligence Indexタスクあたりのコストをその知能スコアと比較することで評価されます。これは、入力、キャッシュヒット、キャッシュ書き込み、および推論トークンの混合レートに基づいて計算されます。

  • Pricing Components: モデルの価格設定は、入力トークン、出力トークン、およびキャッシュヒット価格(100万トークンあたりのUSD)によってセグメント化されています。
  • Cost to Run Index: Artificial Analysis Intelligence Index内のすべての評価を実行するための合計USDコスト。
  • Token Efficiency: Intelligence Indexにおける単一のタスクを完了するために使用される出力トークンの加重平均数。

コンテキストウィンドウとモデルアーキテクチャ

GLM-5.2は、Retrieval Augmented Generation (RAG) ワークフローを決定するコンテキストウィンドウをサポートしています。これは、推論と情報検索のために大量のデータを処理することを必要とします。

モデルのオープンウェイト版については、Artificial Analysisは総パラメータ数(学習可能な重みの総数)とアクティブパラメータ数(各推論フォワードパス中に実行されるパラメータ)の両方を追跡しています。これは、Mixture of Experts (MoE) アーキテクチャにおいて、アクティブパラメータが総パラメータ数よりも少ない場合に特に重要です。

Sources