GLM-5.3-Flash 推理基础设施:AI 代理如何构建 10 万加速器服务

摘要

GLM-5.3-Flash 的推理服务是在一个拥有超过 10 万个中国 AI 加速器的集群上,在不到两周的时间内从零开始构建的,其中 Infra Agent(一个由 GLM-5.3 驱动的编码助手)承担了大部分工作。通过结合激进的内存侧优化、自定义的 Encode-Prefill-Decode 架构,以及一个将稀疏的端到端指标转化为细粒度、可操作信号的“密集反馈”循环,团队将吞吐量提高了三倍,并达到了与主流 NVIDIA GPU 相当的硬件效率。


1. 为什么 GLM-5.3-Flash 的基础设施很重要

  • 该系统展示了朝着**递归自我改进(RSI)**迈出的具体一步:一个帮助设计、构建和优化将训练其继任者的硬件和软件的模型。
  • 在之前未经测试的硬件栈(中国制造的加速器)上实现生产级性能,证明大规模 AI 推理可以脱离 NVIDIA 主导的生态系统。
  • 三倍的吞吐量提升和六天内处理的 62 万亿个 token 表明,AI 驱动的基础设施工程可以显著缩短开发周期。

2. 从零开始构建 10 万加速器集群

  • 硬件限制:片上内存有限、带宽窄、内核支持不成熟、文档不完整。
  • 模型要求:100 万 token 上下文窗口、多模态输入和新颖的架构。
  • 解决方案:Infra Agent 编写、测试并迭代了底层代码,处理了通常需要高级工程师数周努力的任务。
  • 结果:GLM-5.3-Flash 的所有生产推理都在这个自定义集群上运行,使其成为 OpenCode 和 OpenRouter 上使用最多的模型,别名为 Ox-Alpha

3. 密集反馈:将稀疏指标转化为可操作的指导

“反馈必须是局部的、廉价的、并且可以客观验证的。” – Z-AI 博客

3.1. 局部验证与端到端验证

  • 端到端指标(例如,吞吐量)表明问题,但不说明为什么
  • 密集反馈提供:
    1. 正确性测试 – 内核级别的数值比较。
    2. 运行时日志和执行跟踪 – 精确定位空闲期、争用或错误调度的传输。
    3. 微基准测试 – 隔离特定内核或输入形状的性能。
  • Infra Agent 为每个假设选择最合适的验证方法,避免每次更改都进行昂贵的全服务部署。

3.2. 有效反馈的特征

特征 表现 重要性
局部 “内核 X 在分区后对形状 (64, 1024) 产生了 0.3% 的错误。” 将搜索空间缩小到单个代码路径。
廉价 一个 5 毫秒的微基准测试在几秒内运行,而不是几分钟。 支持快速迭代和早期拒绝不好的想法。
客观 与具有定义容差的参考实现进行比较。 确保观察到的改进是真实的,而不是偶然的。

4. 展示密集反馈的案例研究

4.1. 正确性反馈 – 修复数值精度错误

  • 问题:KDA 内核的上下文并行(CP)路径默认使用 TF32,导致长上下文中的错误累积。
  • 反馈循环
    1. 从并行策略映射到特定内核。
    2. 分区与未分区内核输出的比较揭示了超过 1% 的错误。
    3. 检查确定 TF32 精度是罪魁祸首。
    4. 修复:为两个点积设置 input_precision="tf32x3",在保持 Tensor Core 速度的同时提高精度。
  • 结果:数值错误被消除;修复已合并到上游(参见 PR #1180)。

4.2. 系统行为反馈 – 解决 KV 传输并发瓶颈

  • 问题:Prefill + KV 传输的延迟超过了仅 Prefill 基线的 20% 以上。
  • 反馈循环
    1. 定义了测试场景(Prefill、Prefill + KV、Decode),并设定了 5% 的性能预算。
    2. 执行跟踪分析显示 Python 端的 KV 传输从未与 DeepEP 的调度/合并阶段重叠。
    3. 根本原因:C++ 调用(intranode_dispatchintranode_combine)持有 Python GIL,阻塞了传输线程。
    4. 修复:在这些调用期间释放 GIL。
  • 结果:差距降至 1% 以下;端到端吞吐量相应提高。

4.3. 性能反馈 – 内核级优化带来系统级提升

  • 问题:基线 KDA Decode 内核存在冗余计算和次优的平铺问题。
  • 反馈循环
    1. 代理从现有内核(SGLang、Flash Linear Attention、DeepGEMM)中获取“优化骨架”。
    2. 消融实验确定了三个改进阶段(ReplaySSM 权衡、除法优化、平铺合并)。
    3. 最终版本将四个 V 维度平铺合并到单个线程块中,保持中间值在寄存器中,并用 warp 级归约替换了每个平铺的归约。
  • 结果:比之前版本提速 1.71 倍;累积的内核增益贡献了整体 3 倍的服务级吞吐量提升。

5. 实现 3 倍提升的架构与优化

技术 描述 影响
节点内张量并行(线性注意力和 LM 头) 在节点内的加速器之间拆分计算。 减少每设备内存压力。
ReplaySSM 用计算周期换取减少的内存带宽。 支持更大的上下文窗口。
W8A8 量化 8 位权重和激活表示。 减少内存流量。
混合精度缓存(INT8/FP8/BF16) 每层动态选择缓存精度。 平衡精度与带宽。
层拆分 将重层分离到专用设备上。 提高利用率。
Encode-Prefill-Decode(EPD)分离 解耦三个推理阶段,允许独立扩展。 改善流水线并行性和延迟。

6. 人在回路中的角色

  • 目标定义 – 工程师设定性能目标、安全约束和风险容忍度。
  • 反馈环境设计 – 工程师暴露正确的日志、测试和微基准测试供代理使用。
  • 关键审查 – 人类审计数值安全更改、并发修复以及任何可能影响生产稳定性的代码。
  • 结果 – 代理提出、实现并验证更改;人类只批准那些满足正确性、稳定性和业务标准的更改。

7. 对 AI 驱动的系统工程未来的影响

  • GLM-5.3-Flash 的发布证明,模型驱动的代码生成可以取代传统基础设施工程的大部分,当与密集反馈循环结合时。
  • 三周的开发窗口表明,未来几代模型可以将工程周期从数月压缩到数天,加速更大模型的部署。
  • 虽然真正的递归自我改进(RSI)仍然是一个研究前沿,但这项工作展示了一条实用的、渐进式的路径:首先自动化底层优化,然后让模型影响更高级别的系统设计。
  • 该方法是硬件无关的;类似的密集反馈管道可以应用于 NVIDIA、AMD 或新兴的 ASIC 栈,可能降低全球 AI 推理的成本曲线

8. 社区反应(精选 HN 评论)

“美国芯片出口限制实际上可能对中国 AI 基础设施有利。中国公司被迫加快开发自己的 AI 芯片。” – zicohacks

“我们在一个拥有超过 10 万个中国制造的 AI 加速器的集群上,从零开始构建了一个完整的、生产级的推理服务。GLM-5.3-Flash 的所有生产推理都在这个系统上运行。” – dada216

“看到他们在相同硬件上能榨出这么多性能,真是令人印象深刻。我怀疑同样的过程会在所有 LLM、推理提供商和硬件栈的组合中上演。” – a11r

这些评论强调了这项工作被感知的战略意义,以及更广泛的信念,即激进的软件优化可以抵消硬件限制。


9. 结论

GLM-5.3-Flash 的推理基础设施展示了一种新的工程范式,其中 AI 模型积极参与构建和完善运行它的系统。通过将稀疏的端到端指标转化为密集、局部和可验证的反馈,Infra Agent 能够:

  1. 识别并修复数值正确性错误。
  2. 解决跨层并发问题。
  3. 大规模应用内核级优化知识。

结果——在不到两周的时间内,在 10 万加速器集群上实现了三倍的吞吐量提升——证明了反馈驱动的、AI 辅助的开发可以显著加速 AI 基础设施。人类监督对于安全性和战略方向仍然至关重要,但通往递归自我改进的道路现在明显更短了。

Sources

相关