GLM-5.2:为长时任务而生
GLM-5.2:为长时任务而生
GLM-5.2 概览
GLM-5.2 是一款面向长时任务的旗舰模型,提供坚实的 1M token 上下文,并在 MIT 开源许可证下发布。
关键能力
GLM-5.2 提供坚实的 1M token 上下文以支撑长时工作、具备灵活算力层级的高级编码、通过架构改进降低计算成本,并实现完全开放访问。
坚实的 1M 上下文
GLM-5.2 通过大幅扩展针对编码‑agent 场景的 1M 上下文训练,使模型在长且杂乱的编码‑agent 轨迹中保持质量,而不仅仅是接受更多 token。
具备灵活算力的高级编码
GLM-5.2 提供多种思考算力层级,以在性能与延迟之间取得平衡,用户可以在需要更高性能时分配额外计算资源。
改进的架构
GLM-5.2 引入 IndexShare,在每四层稀疏注意力层中复用同一索引器,使 1M 长度上下文下的每 token FLOPs 降低 2.9×,并改进 MTP 层以支持推测解码,接受长度提升最高可达 20%。
完全开放
GLM-5.2 采用 MIT 许可证发布,无地域限制,提供无国界的技术访问。
长时编码基准的性能表现
GLM-5.2 展示了强大的长时交付能力,在三个基准中均位列开源模型之首。
- 在 FrontierSWE 上,GLM-5.2 仅比 Opus 4.8 落后 1%,比 GPT-5.5 超出 1%,并比 Opus 4.7 高出 11%。
- 在 PostTrainBench 上,GLM-5.2 超越 Opus 4.7 与 GPT-5.5,仅次于 Opus 4.8,排名第二。
- 在 SWE‑Marathon 上,GLM-5.2 落后 Opus 4.8 13%,仍保持仅次于 Opus 系列的第二名。
在全部三项基准中,GLM-5.2 是排名最高的开源模型,证明其 1M 上下文能够转化为实际的长时能力。
标准编码基准的性能表现
GLM-5.2 在标准编码基准上取得了显著提升,缩小了与闭源前沿模型的差距。
- 在 Terminal‑Bench 2.1 上,GLM-5.2 得分 81.0,远超 GLM-5.1 的 63.5,接近 Claude Opus 4.8 的 85.0,并领先 Gemini 3.1 Pro。
- 在 SWE‑bench Pro 上,GLM-5.2 得分 62.1,优于 GLM-5.1 的 58.4。
算力层级控制
GLM-5.2 的算力层级控制让用户能够显式在模型能力与执行速度、计算成本之间进行权衡。
在相同 token 预算下,GLM-5.2 的 agentic 编码性能显著强于 GLM-5.1,能力大致位于 Claude Opus 4.7 与 Claude Opus 4.8 之间。
Max 算力层级为挑战性任务提供额外计算,进一步提升编码能力。
此设计为不同场景提供了灵活的推理模式选择。
支持 1M 上下文的架构
GLM-5.2 的架构改动实现了对超长序列的高效处理。
IndexShare 用于 DSA
在 GLM-5.2 中,每四层 Transformer 共享一个轻量级索引器,放置在第一层并在后续三层复用,从而在三分之二的层中减少索引器点积和 top‑k 操作的计算量。
GLM-5.2 从中期训练(使用 128K 序列长度)起即启用 IndexShare,在长上下文基准上以更少的计算量超越 GLM-5.1。
带 IndexShare 与 KVShare 的 MTP
GLM-5.2 的 MTP 层通过引入 IndexShare 降低成本,并使用 KV 缓存复用消除训练‑推理差异,以提升推测解码效果。
消融实验显示:加入 IndexShare + KV Share 将接受长度从 4.56 提升至 5.10,加入拒绝采样进一步提升至 5.29,加入端到端 TV loss 再提升至 5.47,较基线提升约 20%。
高效服务 1M 上下文长度
GLM-5.2 将最大上下文长度从 200K 扩展至 1M token,推理瓶颈从计算转向 KV‑cache 容量、长上下文 kernel 开销以及 CPU 端开销。
为此,推理引擎通过更细粒度的内存管理(基于 LayerSplit)、与缓存传输协同的 kernel 优化,以及 CPU 端缓存管理与请求调度来降低流水线气泡。
结果表明,随着上下文长度增长,GLM-5.2 的吞吐量优势愈发明显,展现出在长上下文推理场景下的更强可扩展性。
slime 用于 Agentic RL
slime 框架为 GLM-5.2 的 agentic RL 后训练提供了一体化基础设施层,支持多种训练与任务组织模式。
在后训练过程中,slime 用于并行 OPD 训练,高效合并十余个专家模型为最终模型,整个 OPD 训练耗时约两天。
slime 为推理系统提供高度开放且灵活的接口,训练侧可以不同形式接入推理服务,并适配各种并行策略、路由策略、PD 去聚合配置以及部署模式。
在 RL rollout 中积累的配置经验、调度策略与优化路径可复用于生产服务,实现从后训练到部署的直接通道。
结合灵活的训练‑推理资源组织与 KV‑cache FP8,slime 为 GLM-5.2 的大规模 agentic RL 训练提供关键基础设施支撑,提升系统效率、rollout 吞吐以及大规模推理并发能力。
面向长时任务的 RL 与防黑客机制
GLM-5.2 的长时任务 RL 从组级优化转向基于 critic 的 PPO 形式,使用 critic 估计 token 级优势,学习单次 rollout 的经验。
该单 rollout 形式天然支持压缩,因为它对 prompt 产生的轨迹数量或长度没有约束。
为防止编码 agent 的 reward hacking,GLM-5.2 引入两阶段的 anti‑hack 模块:首先使用规则过滤器高召回地标记潜在 hack,随后由 LLM 判官检查意图以保持高精度。
系统在每一步监控工具调用;若检测到 hack,则拦截调用并返回虚假信息,使 rollout 在处理无效行为后继续进行。
此在线防护避免了因 rollout 突然中止导致的训练不稳定和模型崩溃。
快速上手 GLM-5.2
使用 GLM-5.2 与 GLM Coding Plan
GLM-5.2 已在 ZCode、Claude Code、OpenCode 等主流编码 agent 中可用。
对于 GLM Coding Plan 订阅用户,模型已完成部署;只需将模型名称设为 "GLM-5.2"(在 Claude Code 中使用 "GLM-5.2[1m]" 可激活 1M 上下文)即可启用。
可根据任务需求选择不同的思考算力层级(High 或 Max)。
GLM-5.2 在高峰时段消耗配额为 3×,非高峰时段为 2×;作为截至 9 月底的限时促销,非高峰使用费用为 1×。
高峰时段定义为每日 UTC+8(北京时间)14:00‑18:00。
桌面 agent ZCode 基于 GLM-5.2,提供 /goal 命令用于长时任务、SSH 远程开发以及移动端控制。
特别优惠:在 ZCode 中通过 Coding Plan 使用 GLM-5.2 可获得 1.5× 的有效配额,优惠截至 6 月 30 日。
用户可前往 https://z.ai/subscribe 开始构建。
在 Z.ai 与 GLM-5.2 对话
GLM-5.2 已在 https://chat.z.ai/ 开放聊天入口。
本地部署 GLM-5.2
模型权重已在 Hugging Face(https://huggingface.co/zai-org/GLM-5.2)和 ModelScope(https://modelscope.cn/models/ZhipuAI/GLM-5.2)公开。
本地部署时,GLM-5.2 支持包括 transformers、vLLM、SGLang、xLLM、ktransformers 在内的多种推理框架。