GLM-5.2:为长时任务而生

GLM-5.2:为长时任务而生

GLM-5.2 概览

GLM-5.2 是一款面向长时任务的旗舰模型,提供坚实的 1M token 上下文,并在 MIT 开源许可证下发布。

关键能力

GLM-5.2 提供坚实的 1M token 上下文以支撑长时工作、具备灵活算力层级的高级编码、通过架构改进降低计算成本,并实现完全开放访问。

坚实的 1M 上下文

GLM-5.2 通过大幅扩展针对编码‑agent 场景的 1M 上下文训练,使模型在长且杂乱的编码‑agent 轨迹中保持质量,而不仅仅是接受更多 token。

具备灵活算力的高级编码

GLM-5.2 提供多种思考算力层级,以在性能与延迟之间取得平衡,用户可以在需要更高性能时分配额外计算资源。

改进的架构

GLM-5.2 引入 IndexShare,在每四层稀疏注意力层中复用同一索引器,使 1M 长度上下文下的每 token FLOPs 降低 2.9×,并改进 MTP 层以支持推测解码,接受长度提升最高可达 20%。

完全开放

GLM-5.2 采用 MIT 许可证发布,无地域限制,提供无国界的技术访问。

长时编码基准的性能表现

GLM-5.2 展示了强大的长时交付能力,在三个基准中均位列开源模型之首。

  • FrontierSWE 上,GLM-5.2 仅比 Opus 4.8 落后 1%,比 GPT-5.5 超出 1%,并比 Opus 4.7 高出 11%。
  • PostTrainBench 上,GLM-5.2 超越 Opus 4.7 与 GPT-5.5,仅次于 Opus 4.8,排名第二。
  • SWE‑Marathon 上,GLM-5.2 落后 Opus 4.8 13%,仍保持仅次于 Opus 系列的第二名。

在全部三项基准中,GLM-5.2 是排名最高的开源模型,证明其 1M 上下文能够转化为实际的长时能力。

标准编码基准的性能表现

GLM-5.2 在标准编码基准上取得了显著提升,缩小了与闭源前沿模型的差距。

  • Terminal‑Bench 2.1 上,GLM-5.2 得分 81.0,远超 GLM-5.1 的 63.5,接近 Claude Opus 4.8 的 85.0,并领先 Gemini 3.1 Pro。
  • SWE‑bench Pro 上,GLM-5.2 得分 62.1,优于 GLM-5.1 的 58.4。

算力层级控制

GLM-5.2 的算力层级控制让用户能够显式在模型能力与执行速度、计算成本之间进行权衡。

在相同 token 预算下,GLM-5.2 的 agentic 编码性能显著强于 GLM-5.1,能力大致位于 Claude Opus 4.7 与 Claude Opus 4.8 之间。

Max 算力层级为挑战性任务提供额外计算,进一步提升编码能力。

此设计为不同场景提供了灵活的推理模式选择。

支持 1M 上下文的架构

GLM-5.2 的架构改动实现了对超长序列的高效处理。

IndexShare 用于 DSA

在 GLM-5.2 中,每四层 Transformer 共享一个轻量级索引器,放置在第一层并在后续三层复用,从而在三分之二的层中减少索引器点积和 top‑k 操作的计算量。

GLM-5.2 从中期训练(使用 128K 序列长度)起即启用 IndexShare,在长上下文基准上以更少的计算量超越 GLM-5.1。

带 IndexShare 与 KVShare 的 MTP

GLM-5.2 的 MTP 层通过引入 IndexShare 降低成本,并使用 KV 缓存复用消除训练‑推理差异,以提升推测解码效果。

消融实验显示:加入 IndexShare + KV Share 将接受长度从 4.56 提升至 5.10,加入拒绝采样进一步提升至 5.29,加入端到端 TV loss 再提升至 5.47,较基线提升约 20%。

高效服务 1M 上下文长度

GLM-5.2 将最大上下文长度从 200K 扩展至 1M token,推理瓶颈从计算转向 KV‑cache 容量、长上下文 kernel 开销以及 CPU 端开销。

为此,推理引擎通过更细粒度的内存管理(基于 LayerSplit)、与缓存传输协同的 kernel 优化,以及 CPU 端缓存管理与请求调度来降低流水线气泡。

结果表明,随着上下文长度增长,GLM-5.2 的吞吐量优势愈发明显,展现出在长上下文推理场景下的更强可扩展性。

slime 用于 Agentic RL

slime 框架为 GLM-5.2 的 agentic RL 后训练提供了一体化基础设施层,支持多种训练与任务组织模式。

在后训练过程中,slime 用于并行 OPD 训练,高效合并十余个专家模型为最终模型,整个 OPD 训练耗时约两天。

slime 为推理系统提供高度开放且灵活的接口,训练侧可以不同形式接入推理服务,并适配各种并行策略、路由策略、PD 去聚合配置以及部署模式。

在 RL rollout 中积累的配置经验、调度策略与优化路径可复用于生产服务,实现从后训练到部署的直接通道。

结合灵活的训练‑推理资源组织与 KV‑cache FP8,slime 为 GLM-5.2 的大规模 agentic RL 训练提供关键基础设施支撑,提升系统效率、rollout 吞吐以及大规模推理并发能力。

面向长时任务的 RL 与防黑客机制

GLM-5.2 的长时任务 RL 从组级优化转向基于 critic 的 PPO 形式,使用 critic 估计 token 级优势,学习单次 rollout 的经验。

该单 rollout 形式天然支持压缩,因为它对 prompt 产生的轨迹数量或长度没有约束。

为防止编码 agent 的 reward hacking,GLM-5.2 引入两阶段的 anti‑hack 模块:首先使用规则过滤器高召回地标记潜在 hack,随后由 LLM 判官检查意图以保持高精度。

系统在每一步监控工具调用;若检测到 hack,则拦截调用并返回虚假信息,使 rollout 在处理无效行为后继续进行。

此在线防护避免了因 rollout 突然中止导致的训练不稳定和模型崩溃。

快速上手 GLM-5.2

使用 GLM-5.2 与 GLM Coding Plan

GLM-5.2 已在 ZCode、Claude Code、OpenCode 等主流编码 agent 中可用。

对于 GLM Coding Plan 订阅用户,模型已完成部署;只需将模型名称设为 "GLM-5.2"(在 Claude Code 中使用 "GLM-5.2[1m]" 可激活 1M 上下文)即可启用。

可根据任务需求选择不同的思考算力层级(High 或 Max)。

GLM-5.2 在高峰时段消耗配额为 3×,非高峰时段为 2×;作为截至 9 月底的限时促销,非高峰使用费用为 1×。

高峰时段定义为每日 UTC+8(北京时间)14:00‑18:00。

桌面 agent ZCode 基于 GLM-5.2,提供 /goal 命令用于长时任务、SSH 远程开发以及移动端控制。

特别优惠:在 ZCode 中通过 Coding Plan 使用 GLM-5.2 可获得 1.5× 的有效配额,优惠截至 6 月 30 日。

用户可前往 https://z.ai/subscribe 开始构建。

在 Z.ai 与 GLM-5.2 对话

GLM-5.2 已在 https://chat.z.ai/ 开放聊天入口。

本地部署 GLM-5.2

模型权重已在 Hugging Face(https://huggingface.co/zai-org/GLM-5.2)和 ModelScope(https://modelscope.cn/models/ZhipuAI/GLM-5.2)公开。

本地部署时,GLM-5.2 支持包括 transformers、vLLM、SGLang、xLLM、ktransformers 在内的多种推理框架。

Sources