GLM-5.3 发布:前沿编程与涌现的网络安全能力

TL;DR

GLM-5.3 通过在相同基础模型上进行后训练扩展,实现了比 GLM-5.2 提升 50% 的编程能力,并在网络安全基准测试中刷新了开源记录。


为什么后训练扩展至关重要

GLM-5.3 表明,仅扩展后训练阶段可以带来巨大的收益,而无需改变底层架构。Z.ai 复用了 GLM-5.2 基础模型,增加了更多长程环境,并提升了计算量。其结果是一个在编程和安全任务上超越了更大规模闭源竞争对手的模型,同时保持了开源权重。


更强的编程性能

核心收益

  • Z.ai Code Bench: 比 GLM-5.2 提升了 50%。
  • Terminal Bench 3.0: 28.3% 对比 4.6% (GLM-5.2)。
  • DeepSWE v1.1: 66.9% 对比 46.2%。
  • Agents' Last Exam: 28.5% 对比 23.8%。

收益是如何实现的

  • 真实环境扩展: Z.ai 合成了数千个可执行、可验证的任务,模拟多日工程工作流(例如:诊断 ML 训练流水线的瓶颈、优化代码以及提供可衡量的速度提升)。
  • 自动化环境生成: 研究智能体(Research agents)从实际工作中提取模式,将其转化为可运行的长程任务,并由评判智能体(judge agent)在没有参考答案的情况下验证其可解性。
  • RL with SAO compaction: 将 GLM-5.2 的相同 RL 策略(SAO with compaction)应用于新环境,保留了长程任务的改进。
  • Token 效率: 在 Z.ai Code Bench 上,GLM-5.3 在约 75K 输出 token 时达到了 34.5% 的成功率,击败了 GLM-5.2 的 23.4% (在 96K token 时),并在同等投入下超越了 Claude Opus 4.8。

"GLM-5.3 提升了性能和 token 效率。它在每个投入水平上都比 GLM-5.2 提供了显著更强的智能体编程结果,同时消耗了更少的输出 token。" – Z.ai blog


涌现的网络安全能力

基准测试亮点

Benchmark GLM-5.3 GLM-5.2 Next-best open model
CyberGym (vulnerability discovery) 84.5% 77.2% Mythos 5 (83.8%)
ExploitBench (full exploitation chain) 54.4% 24.4% Mythos 5 (78.0%)
ExploitGym (2 h / 6 h) 105 / 130 tasks 29 / 39 tasks Mythos 5 (181 / 247)

此处“涌现”的含义

扩展后训练引入了漏洞发现数据,但模型很快学会了在多个漏洞利用阶段之间进行推理,从而产生连贯的端到端攻击计划。在漏洞利用链中位置更高的基准测试中,收益更为显著,这表明模型的推理深度正在比其原始的漏洞识别能力扩展得更快。

现实世界的影响

  • 发现 2,436 个漏洞,分布在 269 个 OSS 项目中,包括 1,097 个中高严重程度的问题。
  • 最古老的漏洞可追溯至 1981 年;发现前的平均寿命为 26.6 年
  • 发现结果已在公开的 Z.ai Security Disclosure Ledger (https://cvd.z.ai/) 中进行追踪,将已披露的 CVE 与受禁运处理的报告分开处理。

"许多漏洞在数年甚至数十年间都未被察觉,最古老的可以追溯到大约 40 年前。" – Z.ai blog


收益背后的训练栈

slime framework

  • 统一数据流: Slime 将 Megatron 训练、SGLang rollouts 和长程环境结合在单一流水线中。
  • 算法升级: 增加了 top-p mask、top-k 和 full-vocab OPD,以及 R3-style 数值对齐(log-prob drift < 1e-7,降幅 > 99.99%)。
  • 系统效率: 分层式本地存储缓存和多教师 OPD 减轻了内存压力;工作负载感知调度提高了长程编程任务的 RL 吞吐量达 2.3x

这些工程上的进步使得在不为每次发布而重建整个训练栈的情况下,持续添加新环境变得切实可行。


API 变更与使用指南

  • 思考投入水平: low, high, max。不再支持之前的 thinking.type: "disabled"

  • 默认配置: 对于编程任务,建议使用 reasoning_effort: "max"

  • 迁移指南: 在切换模型 ID 之前,请将请求更新为 { "model": "glm-5.3", "thinking": { "type": "enabled" }, "reasoning_effort": "low" },否则调用将失败。


社区反应 (HN comments)

  • 积极响应: 用户们称赞了清晰的工程化写作和开源立场。一位评论者指出,结果是 "just GLM-5.2 with post-training magic" (即:仅通过后训练魔法来实现提升),但仍然令人印象深刻。
  • 安全 concerns: 几位用户对安全评估进行了质疑,指出如果一个具备大规模漏洞利用能力的模型在没有强力护栏(guardrails)的情况下发布,可能会带来风险。
  • 开源许可: 一些人表达了对宽松的 FOSS 许可的愿望;其他人则强调了其他中国模型向限制性使用条款转变的趋势。
  • 多模态 gap: 一个反复出现的投诉是缺乏视觉能力,这限制了在需要截图或 UI 分析的任务中的适用性。
  • 基准测试怀疑论: 几位评论者问及这些改进是否反映了真实的性能提升,还是仅仅是对基准测试集进行过拟合(over-fitting)?

展望

GLM-5.3 展示了后训练扩展可以缩小与更大规模闭源模型在编程和安全领域的差距。开源权重发布(预计将在两 weeks 之后)两周周内,开源权重发布(预计将在两周内)将使社区能够进一步审计、扩展和基准测试该模型。持续的进阶可能取决于:

  1. 更自主的环境合成: 减少人类在环(human-in-the-loop)的瓶颈。
  2. 多模态扩展: 处理现实世界开发中常见的视觉输入。
  3. 鲁棒的安全性框架: 在强大的网络安全能力与负责任的披露(disclosure)在之间平衡两者。

所有基准测试数据均直接取自 Z.ai GLM-5.3 blog post (14 Aug 2026) 和随附的脚注。未进行任何外部数据伪造。

Sources

相关