zai-org/GLM-5
GLM-5: From Vibe Coding to Agentic Engineering
GLM‑5 シリーズ – Z.ai による大規模・長コンテキスト LLM
概要 – Z.ai/GLM チームがリリースしたオープンウェイトの大規模言語モデルファミリー(GLM‑5, GLM‑5.1, GLM‑5.2, GLM‑5.3 および効率重視の GLM‑5.3‑Flash)です。これらのモデルは、コーディング、サイバーセキュリティ、および長期間の代理タスクのために構築されており、最大 100万トークンコンテキスト をサポートします。
重要性 – 前モデルの GLM‑4.x 系列と比較して、GLM‑5 モデルはパラメータ数(合計 744B、アクティブ 40B)を倍増させ、事前学習データを 28.5T トークンに増やしました。チームは、公開ベンチマーク(Terminal‑Bench, SWE‑Bench, CyberGym, Vending Bench など)において最先端の結果を報告しており、コーディング、推理、長期間の計画能力において最高のオープンソース性能を主張しています。
主な技術的ハイライト
- 長コンテキスト能力 – GLM‑5.2 は、実質的に 1M トークン のコンテキストウィンドウを導入し、非常に長いドキュメントや多段階のツール使用を可能にします。
- ハイブリッド Sparse/Linear Attention – GLM‑5.3‑Flash は、疎な(sparse)アテンションと密な(dense)アテンションを組み合わせた新しいアーキテクチャを採用し、精密な長距離推理を維持しつつ、サービング・コストを削減します。
- IndexShare – 4つの疎なアテンション層にわたる共有インデックスを使用し、1M コンテキスト長において FLOPs を約 2.9 倍削減します。
- Manifold‑Constrained Hyper‑Connections (mHC) – Flash バリアントにおいて、スケーリング効率を向上させるために使用されます。
- Reasoning‑effort control – 新しいモデルは
reasoning_effortパラメータ(low,high,max)およびclear_thinkingフラグを提供し、レイテンシと性能のトレードオフを行えます。 - Reinforcement‑learning infrastructure – slime ライブラリ(非同期 RL)が、微調整およびポストトレーニング用に提供されています。
モデルのサイズ & フォーマット
| Model | Parameters (total / active) | Precision options | Where to download |
|---|---|---|---|
| GLM‑5.3 | 744B / 40B | FP8, BF16 | Hugging Face, ModelScope |
| GLM‑5.3‑Flash | 320B / 18B | FP8, BF16 | Hugging Face, ModelScope |
| GLM‑5.2 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
| GLM‑5.1 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
| GLM‑5 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
ローカルでのモデル実行 – リポジトリには、GLM‑5 シリーズ向けにレシピが用意されているいくつかのインフェレンス・バックエンドが記載されています:
- SGLang – 専用 cookbook による高速サービング。
- vLLM – 高スループット・インフェレンス;各モデル向けのレシピが提供されています。
- Transformers (🤗) – 公式モデルカードとドキュメント。
- KTransformers – カーネルレベルの加速チュートリアル。
- Unsloth – 軽量なデプロイメントガイド。
- Context-aware Ascend NPU – vLLM‑Ascend, xLLM などによるサポート。
微調整 – モデルは以下を用いてさらに適応可能です:
- slime(チームの非同期 RL フレームワーク)による強化学習ベースの微調整。
- ms-swift による教師学級微調整 (SFT), PPO, および GRPO。
コミュニティ & リソース ext:
- 公式 Discord と WeChat グループによるユーザーサポート。
- GLM‑5.3, GLM‑5.3‑Flash, および GLM‑5.2 に関するブログ記事。
- arXiv 上の技術報告書 (arXiv:2602.15763) に、アーキテクチャと学習データを詳細に記載しています。
引用 – 研究において GLM‑5 モデルを使用する場合、提供された arXiv 技術報告書を引用してください(README に BibTeX が含まれています)。
上記の情報はリポジトリの README から直接引用されています。追加の主張は含まれていません。
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch