zai-org/GLM-5
GLM-5: From Vibe Coding to Agentic Engineering
GLM‑5 系列 – Z.ai 開發的大規模、長上下文 LLM
是什麼 – 由 Z.ai/GLM 團隊發布的開源權重大型語言模型系列(GLM‑5, GLM‑5.1, GLM‑5.2, GLM‑5.3 以及注重效率的 GLM‑5.3‑Flash)。這些模型是為 程式碼編寫、網路安全與長程代理任務 而打造的,並支援最高 100 萬 token 上下文。
為什麼重要 – 與之前的 GLM‑4.x 系列相比,GLM‑5 模型將參數數量倍增(總計最高 744B,啟動參數 40B),並將預訓練數據量增加到 28.5T tokens。團隊在多項公開基準測試(Terminal‑Bench, SWE‑Bench, CyberGym, Vending Bench 等)中報告了頂尖的結果,並聲稱在推理、程式碼編寫與長程規劃能力上具備最佳的開源性能。
關鍵技術亮點
- 長上下文能力 – GLM‑5.2 引入了 穩定的 1M token 上下文窗口,能夠在極長文件或多步驟工具使用中持續工作。
- 混合稀疏/線性注意力機制 – GLM‑5.3‑Flash 採用了結合稀疏與密集注意力機制的全新架構,在保持精確長程推理的同時,降低了部署成本。
- IndexShare – 跨四個稀疏注意力層的共享索引器,在 1M 上下文長度下可將 FLOPs 降低約 2.9 倍。
- Manifold‑Constrained Hyper‑Connections (mHC) – 用於 Flash 變體以提升擴展效率。
- 推理努力程度控制 – 新模型提供
reasoning_effort參數(low,high,max)以及clear_thinking標記,用於在延遲與性能之間進行權衡。 - 強化學習基礎設施 – 提供 slime 函式庫(非同步 RL)用於微調與後訓練。
模型尺寸與格式
| Model | Parameters (total / active) | Precision options | Where to download |
|---|---|---|---|
| GLM‑5.3 | 744B / 40B | FP8, BF16 | Hugging Face, ModelScope |
| GLM‑5.3‑Flash | 320B / 18B | FP8, BF16 | Hugging Face, ModelScope |
| GLM‑5.2 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
| GLM‑5.1 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
| GLM‑5 | 744B / 40B | BF16, FP8 | Hugging Face, ModelScope |
本地運行模型 – 儲存庫列出了幾種已針對 GLM‑5 系列提供配置方案的推理引擎後端:
- SGLang – 提供快速部署的專用 cookbook。
- vLLM – 高吞吐量推理;為每個模型提供了配置方案。
- Transformers (🤗) – 官方模型卡片與文件。
- KTransformers – 內核級加速教學。
- Unsloth – 輕量化部署指南。
- Ascend NPU – 透過 vLLM‑Ascend, xLLM 等支援。
微調 – 模型可以透過以下方式進一步適應:
- slime(團隊的非同步 RL 框架)用於基於強化學習的微調。
- ms‑swift 用於監督式微調 (SFT), PPO, 與 GRPO。
社群與資源
- 官方 Discord 與 WeChat 群組提供用戶支持。
- Blog posts 描述了 GLM‑5.3, GLM‑5.3‑Flash, 與 GLM‑5.2。
- arXiv 上的技術報告 (arXiv:2602.15763) 詳細介紹了架構與訓練數據。
引用 – 若您在研究中使用任何 GLM‑5 模型,請引用提供的 arXiv 技術報告(README 中包含完整的 BibTeX)。
以上資訊直接取自儲存庫的 README;未添加任何額外聲明。
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch