GLM-5.3-Flash 推理基础设施:AI 代理如何构建 10 万加速器服务
摘要
GLM-5.3-Flash 的推理服务是在一个拥有超过 10 万个中国 AI 加速器的集群上,在不到两周的时间内从零开始构建的,其中 Infra Agent(一个由 GLM-5.3 驱动的编码助手)承担了大部分工作。通过结合激进的内存侧优化、自定义的 Encode-Prefill-Decode 架构,以及一个将稀疏的端到端指标转化为细粒度、可操作信号的“密集反馈”循环,团队将吞吐量提高了三倍,并达到了与主流 NVIDIA GPU 相当的硬件效率。
1. 为什么 GLM-5.3-Flash 的基础设施很重要
- 该系统展示了朝着**递归自我改进(RSI)**迈出的具体一步:一个帮助设计、构建和优化将训练其继任者的硬件和软件的模型。
- 在之前未经测试的硬件栈(中国制造的加速器)上实现生产级性能,证明大规模 AI 推理可以脱离 NVIDIA 主导的生态系统。
- 三倍的吞吐量提升和六天内处理的 62 万亿个 token 表明,AI 驱动的基础设施工程可以显著缩短开发周期。
2. 从零开始构建 10 万加速器集群
- 硬件限制:片上内存有限、带宽窄、内核支持不成熟、文档不完整。
- 模型要求:100 万 token 上下文窗口、多模态输入和新颖的架构。
- 解决方案:Infra Agent 编写、测试并迭代了底层代码,处理了通常需要高级工程师数周努力的任务。
- 结果:GLM-5.3-Flash 的所有生产推理都在这个自定义集群上运行,使其成为 OpenCode 和 OpenRouter 上使用最多的模型,别名为 Ox-Alpha。
3. 密集反馈:将稀疏指标转化为可操作的指导
“反馈必须是局部的、廉价的、并且可以客观验证的。” – Z-AI 博客
3.1. 局部验证与端到端验证
- 端到端指标(例如,吞吐量)表明有问题,但不说明为什么。
- 密集反馈提供:
- 正确性测试 – 内核级别的数值比较。
- 运行时日志和执行跟踪 – 精确定位空闲期、争用或错误调度的传输。
- 微基准测试 – 隔离特定内核或输入形状的性能。
- Infra Agent 为每个假设选择最合适的验证方法,避免每次更改都进行昂贵的全服务部署。
3.2. 有效反馈的特征
| 特征 | 表现 | 重要性 |
|---|---|---|
| 局部 | “内核 X 在分区后对形状 (64, 1024) 产生了 0.3% 的错误。” | 将搜索空间缩小到单个代码路径。 |
| 廉价 | 一个 5 毫秒的微基准测试在几秒内运行,而不是几分钟。 | 支持快速迭代和早期拒绝不好的想法。 |
| 客观 | 与具有定义容差的参考实现进行比较。 | 确保观察到的改进是真实的,而不是偶然的。 |
4. 展示密集反馈的案例研究
4.1. 正确性反馈 – 修复数值精度错误
- 问题:KDA 内核的上下文并行(CP)路径默认使用 TF32,导致长上下文中的错误累积。
- 反馈循环:
- 从并行策略映射到特定内核。
- 分区与未分区内核输出的比较揭示了超过 1% 的错误。
- 检查确定 TF32 精度是罪魁祸首。
- 修复:为两个点积设置
input_precision="tf32x3",在保持 Tensor Core 速度的同时提高精度。
- 结果:数值错误被消除;修复已合并到上游(参见 PR #1180)。
4.2. 系统行为反馈 – 解决 KV 传输并发瓶颈
- 问题:Prefill + KV 传输的延迟超过了仅 Prefill 基线的 20% 以上。
- 反馈循环:
- 定义了测试场景(Prefill、Prefill + KV、Decode),并设定了 5% 的性能预算。
- 执行跟踪分析显示 Python 端的 KV 传输从未与 DeepEP 的调度/合并阶段重叠。
- 根本原因:C++ 调用(
intranode_dispatch、intranode_combine)持有 Python GIL,阻塞了传输线程。 - 修复:在这些调用期间释放 GIL。
- 结果:差距降至 1% 以下;端到端吞吐量相应提高。
4.3. 性能反馈 – 内核级优化带来系统级提升
- 问题:基线 KDA Decode 内核存在冗余计算和次优的平铺问题。
- 反馈循环:
- 代理从现有内核(SGLang、Flash Linear Attention、DeepGEMM)中获取“优化骨架”。
- 消融实验确定了三个改进阶段(ReplaySSM 权衡、除法优化、平铺合并)。
- 最终版本将四个 V 维度平铺合并到单个线程块中,保持中间值在寄存器中,并用 warp 级归约替换了每个平铺的归约。
- 结果:比之前版本提速 1.71 倍;累积的内核增益贡献了整体 3 倍的服务级吞吐量提升。
5. 实现 3 倍提升的架构与优化
| 技术 | 描述 | 影响 |
|---|---|---|
| 节点内张量并行(线性注意力和 LM 头) | 在节点内的加速器之间拆分计算。 | 减少每设备内存压力。 |
| ReplaySSM | 用计算周期换取减少的内存带宽。 | 支持更大的上下文窗口。 |
| W8A8 量化 | 8 位权重和激活表示。 | 减少内存流量。 |
| 混合精度缓存(INT8/FP8/BF16) | 每层动态选择缓存精度。 | 平衡精度与带宽。 |
| 层拆分 | 将重层分离到专用设备上。 | 提高利用率。 |
| Encode-Prefill-Decode(EPD)分离 | 解耦三个推理阶段,允许独立扩展。 | 改善流水线并行性和延迟。 |
6. 人在回路中的角色
- 目标定义 – 工程师设定性能目标、安全约束和风险容忍度。
- 反馈环境设计 – 工程师暴露正确的日志、测试和微基准测试供代理使用。
- 关键审查 – 人类审计数值安全更改、并发修复以及任何可能影响生产稳定性的代码。
- 结果 – 代理提出、实现并验证更改;人类只批准那些满足正确性、稳定性和业务标准的更改。
7. 对 AI 驱动的系统工程未来的影响
- GLM-5.3-Flash 的发布证明,模型驱动的代码生成可以取代传统基础设施工程的大部分,当与密集反馈循环结合时。
- 三周的开发窗口表明,未来几代模型可以将工程周期从数月压缩到数天,加速更大模型的部署。
- 虽然真正的递归自我改进(RSI)仍然是一个研究前沿,但这项工作展示了一条实用的、渐进式的路径:首先自动化底层优化,然后让模型影响更高级别的系统设计。
- 该方法是硬件无关的;类似的密集反馈管道可以应用于 NVIDIA、AMD 或新兴的 ASIC 栈,可能降低全球 AI 推理的成本曲线。
8. 社区反应(精选 HN 评论)
“美国芯片出口限制实际上可能对中国 AI 基础设施有利。中国公司被迫加快开发自己的 AI 芯片。” – zicohacks
“我们在一个拥有超过 10 万个中国制造的 AI 加速器的集群上,从零开始构建了一个完整的、生产级的推理服务。GLM-5.3-Flash 的所有生产推理都在这个系统上运行。” – dada216
“看到他们在相同硬件上能榨出这么多性能,真是令人印象深刻。我怀疑同样的过程会在所有 LLM、推理提供商和硬件栈的组合中上演。” – a11r
这些评论强调了这项工作被感知的战略意义,以及更广泛的信念,即激进的软件优化可以抵消硬件限制。
9. 结论
GLM-5.3-Flash 的推理基础设施展示了一种新的工程范式,其中 AI 模型积极参与构建和完善运行它的系统。通过将稀疏的端到端指标转化为密集、局部和可验证的反馈,Infra Agent 能够:
- 识别并修复数值正确性错误。
- 解决跨层并发问题。
- 大规模应用内核级优化知识。
结果——在不到两周的时间内,在 10 万加速器集群上实现了三倍的吞吐量提升——证明了反馈驱动的、AI 辅助的开发可以显著加速 AI 基础设施。人类监督对于安全性和战略方向仍然至关重要,但通往递归自我改进的道路现在明显更短了。
Sources
相关
- Dispatch
- 项目
- Dispatch
- Dispatch
- Dispatch