GLM-5.3 發佈:前沿編程與新興網絡能力

TL;DR

GLM‑5.3 透過對同一個基礎模型進行後訓練擴展(post‑training scaling),實現了比 GLM‑5.2 高出 50% 的編程能力提升,並在網絡安全基準測試中創下新的開源紀錄。


為什麼後訓練擴展至關重要

GLM‑5.3 證明了僅擴展後訓練階段即可在不改變底層架構的情況下獲得巨大增益。Z.ai 重用了 GLM‑5.2 的基礎模型,增加了更多長程環境(long‑horizon environments)並提升了計算量。結果是,該模型在編程和安全任務上的表現超越了規模更大的閉源競爭對手,同時保持開源權重。


更強大的編程性能

核心增益

  • Z.ai Code Bench: 比 GLM‑5.2 提升了 50%。
  • Terminal Bench 3.0: 28.3% vs. 4.6% (GLM‑5.2)。
  • DeepSWE v1.1: 66.9% vs. 46.2%。
  • Agents' Last Exam: 28.5% vs. 23.8%。

如何實現這些增益

  • 現實環境擴展: Z.ai 合成了數千個可執行、可驗證的任務,模擬多天的工程工作流(例如:診斷 ML 訓練流水線中的瓶頸、優化代碼並提供可衡量的加速)。
  • 自動化環境生成: 研究代理(research agents)從實際工作中收集模式,將其轉化為可運行的長程任務,並由一個裁判代理(judge agent)在沒有參考解的情況下驗證可解性。
  • 帶有 SAO 壓縮的 RL: 將 GLM‑5.2 的相同 RL 策略(帶有壓縮的 SAO)應用於新環境,保留了在長程任務上的改進。
  • Token 效率: 在 Z.ai Code Bench 上,GLM‑5.3 在約 75K 輸出 token 時達到 34.5% 的成功率,擊敗了 GLM‑5.2 在 96K token 時的 23.4%,並在同等投入下超越了 Claude Opus 4.8。

"GLM‑5.3 同時提升了性能和 token 效率。在每個投入水平上,它都提供了比 GLM‑5.2 明顯更強的代理編程結果,同時消耗更少的輸出 token。" – Z.ai blog


新興網絡能力

基準測試亮點

基準測試 GLM‑5.3 GLM‑5.2 次優開源模型
CyberGym (漏洞發現) 84.5% 77.2% Mythos 5 (83.8%)
ExploitBench (完整攻擊鏈) 54.4% 24.4% Mythos 5 (78.0%)
ExploitGym (2 h / 6 h) 105 / 130 任務 29 / 39 任務 Mythos 5 (181 / 247)

這裡的「新興」是什麼意思

擴展後訓練引入了漏洞發現數據,但模型很快學會了跨多個攻擊階段進行推理,從而產生連貫的端到端攻擊計劃。在攻擊鏈位置較高的基準測試中,增益更明顯,這表明模型的推理深度擴展速度快於其原始的漏洞檢測能力。

現實影響

  • 269 個 OSS 項目中發現了 2,436 個漏洞,其中包括 1,097 個中高嚴重性問題。
  • 最古老的缺陷可追溯至 1981 年;發現前的平均壽命為 26.6 年
  • 研究結果記錄在公開的 Z.ai Security Disclosure Ledger (https://cvd.z.ai/) 中,將已披露的 CVE 與禁運報告分開。

"許多漏洞多年甚至數十年都未被察覺,最古老的可以追溯到大約 40 年前。" – Z.ai blog


增益背後的訓練棧

slime 框架

  • 統一數據流: Slime 在單一流水線上結合了 Megatron 訓練、SGLang rollouts 和長程環境。
  • 算法升級: 增加了 top‑p mask、top‑k 和全詞彙 OPD,以及 R3 風格的數值對齊(log‑prob drift < 1e-7,減少了 > 99.99%)。
  • 系統效率: 分層本地存儲緩存和多教師 OPD 減輕了內存壓力;工作負載感知調度將長程編程任務的 RL 吞吐量提高了 2.3倍

這些工程進步使得在每次發佈時無需重新構建整個棧即可實際添加新環境。


API 變更與使用指南

  • 思考投入水平: low, high, max。之前的 thinking.type: "disabled" 已不再支持。
  • 默認配置: 編程任務建議使用 reasoning_effort: "max"
  • 遷移提示: 在切換模型 ID 之前,請將請求更新為 { "model": "glm-5.3", "thinking": { "type": "enabled" }, "reasoning_effort": "low" },否則調用將失敗。

社群反應 (HN 評論)

  • 正面評價: 用戶讚揚清晰的工程寫作和開源立場。一位評論者指出,結果「只是帶有後訓練魔法的 GLM-5.2」但仍然令人印象深刻。
  • 安全疑慮: 幾位用戶質疑安全評估,指出如果沒有強大的護欄就發佈具備大規模攻擊能力的模型可能具有風險。
  • 開源許可證: 有人表示希望獲得寬鬆的 FOSS 許可證;其他人則強調其他中國模型正轉向受限使用條款。
  • 多模態差距: 一個反覆出現的抱怨是缺乏視覺能力,這限制了需要截圖或 UI 分析任務的適用性。
  • 基準測試懷疑論: 幾位評論者詢問這些改進反映的是真實能力,還是對基準測試集的過擬合。

展望

GLM-5.3 證明了後訓練擴展可以縮小與更大閉源模型在編程和安全領域的差距。開源權重版本(預計兩週內發佈)將使社群能夠進一步審核、擴展和測試該模型。持續的進展可能取決於:

  1. 更自主的環境合成,以減少人機協作的瓶頸。
  2. 多模態擴展,以處理現實開發中常見的視覺輸入。
  3. 強大的安全框架,在強大的網絡能力與負責任的披露之間取得平衡。

所有基準測試數據直接取自 Z.ai GLM-5.3 部落格文章 (2026年8月14日) 及隨附腳註。未捏造外部數據。

Sources

相關