zai-org/GLM-5

GLM-5: From Vibe Coding to Agentic Engineering

GLM‑5 系列 – Z.ai 開發的大規模、長上下文 LLM

是什麼 – 由 Z.ai/GLM 團隊發布的開源權重大型語言模型系列(GLM‑5, GLM‑5.1, GLM‑5.2, GLM‑5.3 以及注重效率的 GLM‑5.3‑Flash)。這些模型是為 程式碼編寫、網路安全與長程代理任務 而打造的,並支援最高 100 萬 token 上下文

為什麼重要 – 與之前的 GLM‑4.x 系列相比,GLM‑5 模型將參數數量倍增(總計最高 744B,啟動參數 40B),並將預訓練數據量增加到 28.5T tokens。團隊在多項公開基準測試(Terminal‑Bench, SWE‑Bench, CyberGym, Vending Bench 等)中報告了頂尖的結果,並聲稱在推理、程式碼編寫與長程規劃能力上具備最佳的開源性能。

關鍵技術亮點

  • 長上下文能力 – GLM‑5.2 引入了 穩定的 1M token 上下文窗口,能夠在極長文件或多步驟工具使用中持續工作。
  • 混合稀疏/線性注意力機制 – GLM‑5.3‑Flash 採用了結合稀疏與密集注意力機制的全新架構,在保持精確長程推理的同時,降低了部署成本。
  • IndexShare – 跨四個稀疏注意力層的共享索引器,在 1M 上下文長度下可將 FLOPs 降低約 2.9 倍。
  • Manifold‑Constrained Hyper‑Connections (mHC) – 用於 Flash 變體以提升擴展效率。
  • 推理努力程度控制 – 新模型提供 reasoning_effort 參數(low, high, max)以及 clear_thinking 標記,用於在延遲與性能之間進行權衡。
  • 強化學習基礎設施 – 提供 slime 函式庫(非同步 RL)用於微調與後訓練。

模型尺寸與格式

Model Parameters (total / active) Precision options Where to download
GLM‑5.3 744B / 40B FP8, BF16 Hugging Face, ModelScope
GLM‑5.3‑Flash 320B / 18B FP8, BF16 Hugging Face, ModelScope
GLM‑5.2 744B / 40B BF16, FP8 Hugging Face, ModelScope
GLM‑5.1 744B / 40B BF16, FP8 Hugging Face, ModelScope
GLM‑5 744B / 40B BF16, FP8 Hugging Face, ModelScope

本地運行模型 – 儲存庫列出了幾種已針對 GLM‑5 系列提供配置方案的推理引擎後端:

  • SGLang – 提供快速部署的專用 cookbook。
  • vLLM – 高吞吐量推理;為每個模型提供了配置方案。
  • Transformers (🤗) – 官方模型卡片與文件。
  • KTransformers – 內核級加速教學。
  • Unsloth – 輕量化部署指南。
  • Ascend NPU – 透過 vLLM‑Ascend, xLLM 等支援。

微調 – 模型可以透過以下方式進一步適應:

  • slime(團隊的非同步 RL 框架)用於基於強化學習的微調。
  • ms‑swift 用於監督式微調 (SFT), PPO, 與 GRPO。

社群與資源

  • 官方 Discord 與 WeChat 群組提供用戶支持。
  • Blog posts 描述了 GLM‑5.3, GLM‑5.3‑Flash, 與 GLM‑5.2。
  • arXiv 上的技術報告 (arXiv:2602.15763) 詳細介紹了架構與訓練數據。

引用 – 若您在研究中使用任何 GLM‑5 模型,請引用提供的 arXiv 技術報告(README 中包含完整的 BibTeX)。


以上資訊直接取自儲存庫的 README;未添加任何額外聲明。

相關