zai-org/GLM-5

GLM-5: From Vibe Coding to Agentic Engineering

GLM‑5 系列 – Z.ai 开发的大规模、长上下文 LLM

是什么 – 由 Z.ai/GLM 团队发布的开源权重大型语言模型系列(GLM‑5, GLM‑5.1, GLM‑5.2, GLM‑5.3 以及注重效率的 GLM‑5.3‑Flash)。这些模型是为 编程、网络安全和长程代理任务 而打造的,并支持最高 100 万 token 上下文

为什么重要 – 与之前的 GLM‑4.x 系列相比,GLM‑5 模型将参数量倍增(总计最高 744B,激活参数 40B)并增加了预训练数据量至 28.5T tokens。团队在多项公开基准测试(Terminal‑Bench, SWE‑Bench, CyberGym, Vending Bench 等)中报告了顶尖的结果,并声称在推理、编程和长程规划能力上具有最佳的开源性能。

关键技术亮点

  • 长上下文能力 – GLM‑5.2 引入了 稳固的 1M token 上下文窗口,能够进行持续的超长文档工作或多步工具使用。

  • 混合稀疏/线性注意力机制 – GLM‑5.3‑Flash 采用了一种新的架构,结合了稀疏和密集注意力机制,在保持精确长程推理的同时,降低了推理服务成本。

  • IndexShare – 跨四个稀疏注意力层共享一个索引器,在 1M 上下文长度下可将 FLOPs 降低约 2.9 倍。

  • Manifold‑Constrained Hyper‑Connections (mHC) – 用于 Flash 变体以提升扩展效率。

  • 推理努力程度控制 – 新模型暴露一个 reasoning_effort 参数(low, high, max)和一个 clear_thinking 标志,用于在延迟与性能之间进行权衡。

  • 强化学习基础设施 – 提供 slime 库(异步 RL)用于微调和后训练。

模型尺寸与格式

Model Parameters (total / active) Precision options Where to download
GLM‑5.3 744B / 40B FP8, BF16 Hugging Face, ModelScope
GLM‑5.3‑Flash 320B / 18B FP8, BF16 Hugging Face, ModelScope
GLM‑5.2 744B / 40B BF16, FP8 Hugging Face, ModelScope
GLM‑5.1 744B / 40B BF16, FP8 Hugging Face, ModelScope
GLM‑5 744B / 40B BF16, FP8 Hugging Face, ModelScope

本地运行模型 – 仓库列表了几个已经针对 GLM‑5 系列提供配置方案的推理后端:

  • SGLang – 快速服务,带有专用 cookbook。
  • vLLM – 高吞吐量推理;为每个模型提供了配置方案。 | Transformers (🤗) – 官方模型卡片与文档。
  • KTransformers – 内核级加速教程。
  • Unsloth – 轻量化部署指南。
  • Ascend NPU – 通过 vLLM‑Ascend, xLLM 等支持。

微调 – 模型可以进一步通过以下方式进行适配:

  • slime(团队的异步 RL 框架)用于基于强化学习的微调。
  • ms‑swift 用于监督式微调 (SFT), PPO, 和 GRPO。

社区 & 资源

  • 官方 Discord 和 WeChat 群组用于用户支持。
  • Blog posts 描述了 GLM‑5.3, GLM‑5.3‑Flash, 和 GLM‑5.2。
  • 技术报告 arXiv (arXiv:2602.15763) 详细介绍了架构与训练数据。

引用 – 如果您在研究中使用任何 GLM‑5 模型,请引用提供的 arXiv 技术报告(README 中包含完整的 BibTeX)。


以上信息直接取自仓库的 README; no additional claims have been added.

相关