GLM-5.2:為長期任務打造
GLM-5.2:為長期任務打造
GLM-5.2 概述
GLM-5.2 是一款為長期任務設計的旗艦模型,具備堅實的 1M 令牌上下文,並以 MIT 開源授權釋出。
主要功能
GLM-5.2 提供堅實的 1M 令牌上下文以支援長期工作、具彈性努力層級的先進編碼、降低計算成本的架構改進,以及完全開放的存取。
堅實的 1M 上下文
GLM-5.2 透過大幅擴展 1M 上下文的編碼代理情境訓練,維持在長且雜亂的編碼代理軌跡中的品質,而不僅僅是接受更多令牌。
具彈性努力的先進編碼
GLM-5.2 提供多種思考努力層級,以在效能與延遲之間取得平衡,讓使用者在需要更高效能時能分配額外計算資源。
改進的架構
GLM-5.2 引入 IndexShare,於每四層稀疏注意力層共享同一個索引器,使 1M 上下文長度下每個令牌的 FLOPs 降低 2.9 倍,並改進 MTP 層以支援推測解碼,將接受長度提升至最高 20%。
完全開放
GLM-5.2 以 MIT 授權釋出,無地域限制,提供無國界的技術存取。
長期編碼基準測試表現
GLM-5.2 展示出強大的長期交付能力,在三項基準測試中排名最高的開源模型。
在 FrontierSWE 上,GLM-5.2 僅比 Opus 4.8 落後 1%,比 GPT-5.5 高出 1%,並且比 Opus 4.7 超過 11%。
在 PostTrainBench 上,GLM-5.2 超過 Opus 4.7 與 GPT-5.5,僅次於 Opus 4.8,排名第二。
在 SWE-Marathon 上,GLM-5.2 落後 Opus 4.8 13%,仍僅次於 Opus 系列,排名第二。
在所有三項基準測試中,GLM-5.2 為最高排名的開源模型,顯示其 1M 上下文可轉化為實際的長期能力。
標準編碼基準測試表現
GLM-5.2 在標準編碼基準測試中取得強勁成果,較前代顯著提升,且縮小與封閉源前沿模型的差距。
在 Terminal‑Bench 2.1 上,GLM-5.2 得分 81.0,對比 GLM-5.1 的 63.5,與 Claude Opus 4.8 的 85.0 相差僅幾分,且領先 Gemini 3.1 Pro。
在 SWE‑bench Pro 上,GLM-5.2 得分 62.1,對比 GLM-5.1 的 58.4。
努力層級控制
GLM-5.2 的努力層級控制讓使用者明確在模型能力、執行速度與計算成本之間取得平衡。
在相似的令牌預算下,GLM-5.2 提供遠超 GLM-5.1 的代理編碼效能,能力大致介於 Claude Opus 4.7 與 Claude Opus 4.8 之間。
Max 努力層級允許在挑戰性任務中額外計算,進一步擴展編碼能力。
此設計賦予使用者彈性,以在不同情境中選擇最適合的推理模式。
1M 上下文的架構
GLM-5.2 的架構變更使得處理極長序列更加高效。
IndexShare 用於 DSA
在 GLM-5.2 中,每四層 transformer 共享一個輕量級索引器,於第一層放置,接下來的三層重複使用,從而在四分之三的層中減少索引器點積與 topk 操作的計算量。
GLM-5.2 從中期訓練開始使用 128K 序列長度的 IndexShare 訓練,在長上下文基準測試中以更少的計算量超越 GLM-5.1。
結合 IndexShare 與 KVShare 的 MTP
GLM-5.2 的 MTP 層透過應用 IndexShare 降低成本,並使用 KV 快取重用以消除訓練與推論之間的差異,從而改進推測解碼。
消融實驗顯示,加入 IndexShare + KV Share 可將接受長度從 4.56 提升至 5.10,加入拒絕抽樣提升至 5.29,加入端到端 TV 損失提升至 5.47,較基線提升 20%。
高效服務 1M 上下文長度
GLM-5.2 將最大上下文長度從 200K 擴展至 1M 令牌,將推論瓶頸從計算轉移至 KV‑cache 容量、長上下文核心開銷與 CPU 端開銷。
為解決此問題,推論引擎透過更細緻的記憶體管理(基於 LayerSplit)、與快取傳輸協調的核心優化,以及 CPU 端快取管理與請求排程,以減少管線氣泡。
因此,隨著上下文長度增長,GLM-5.2 獲得越來越大的吞吐量優勢,展現出在長上下文推論情境中的更強可擴展性。
slime 用於代理式 RL
slime 框架作為 GLM-5.2 代理式 RL 後訓練的整合基礎設施層,支援多種訓練與任務組織模式。
在後訓練過程中,slime 用於執行平行 OPD 訓練,將十餘個專家模型高效合併至最終模型,整個 OPD 訓練約耗時兩天。
slime 提供高度開放且彈性的介面給推論系統,使訓練端能以不同形式連接推論服務,並適應各種平行策略、路由政策、PD 解耦設定與部署模式。
在 RL rollout 中累積的配置經驗、排程策略與優化路徑可在生產服務中重複使用,形成從後訓練到部署的直接路徑。
結合彈性的訓練‑推論資源組織與 KV‑cache FP8,slime 為 GLM-5.2 大規模代理式 RL 訓練提供關鍵基礎設施支援,提升系統效率、 rollout 吞吐量與大規模推論併發性。
具防駭功能的長期任務 RL
GLM-5.2 的長期任務 RL 從群組式優化轉為基於評論家的 PPO 形式,從單一 rollout 中學習,使用評論家估計令牌層級的優勢。
此單一 rollout 形式自然支援壓縮,因為它對提示產生的軌跡數量或長度不設限制。
為防止編碼代理的獎勵駭客行為,GLM-5.2 引入兩階段的防駭模組:先以規則過濾器標記潛在駭客以提升召回率,接著由 LLM 判官檢查意圖以維持高精確度。
系統於每一步監控工具呼叫;若偵測到駭客行為,則阻止呼叫並回傳虛擬資訊,使 rollout 在處理無效行為後得以繼續。
此線上防護可防止因 rollout 突然中止而導致的訓練不穩定與模型崩潰。
GLM-5.2 入門指南
使用 GLM Coding Plan 使用 GLM-5.2
GLM-5.2 可於 ZCode、Claude Code 與 OpenCode 等熱門編碼代理中使用。
對於 GLM Coding Plan 訂閱者,模型已部署;使用者只需將模型名稱設為 "GLM-5.2"(在 Claude Code 中使用 "GLM-5.2[1m]" 以啟用 1M 上下文)即可啟用。
可依任務需求選擇不同的思考努力層級(High 或 Max)。
GLM-5.2 在高峰時段的配額消耗為 3 倍,非高峰時段為 2 倍;作為截至九月底的限時促銷,非高峰時段的計費為 1 倍。
高峰時段定義為每日 UTC+8(北京時間)14:00–18:00。
由 GLM-5.2 提供動力的桌面代理 ZCode,提供 /goal 指令以支援長期任務、SSH 遠端開發與行動裝置控制。
特別優惠:於 ZCode 內透過 Coding Plan 使用 GLM-5.2,可享至 6 月 30 日止 1.5 倍的有效配額。
使用者可前往 https://z.ai/subscribe 開始建置。
在 Z.ai 與 GLM-5.2 聊天
GLM-5.2 現已可於 https://chat.z.ai/ 進行聊天。
本地部署 GLM-5.2
模型權重已公開於 Hugging Face(https://huggingface.co/zai-org/GLM-5.2)與 ModelScope(https://modelscope.cn/models/ZhipuAI/GLM-5.2)。
本地部署時,GLM-5.2 支援包括 transformers、vLLM、SGLang、xLLM 與 ktransformers 在內的推論框架。