OpenAI 超算基础设施与后端系统工程

大规模超算:极端硬件密度的影响

OpenAI 在规模上运营超算集群,这种规模经常会暴露出第三方供应商此前未曾发现的硬件和软件漏洞。由于模型训练的同步特性,使得整个集群的运行速度受最慢节点限制,OpenAI 必须识别并解决在较小环境中可以忽略的性能下降问题。

此规模的技术成果包括:

  • 内核和驱动贡献:在 OpenAI 发现的性能优化常常上游合并到主线内核或包含在新的驱动发布中。
  • 计算效率:小的代码改动(例如一行修复)可以带来显著的节省,例如在整个集群中每周大约减少六天的计算时间。
  • 供应商合作:硬件供应商经常通过 OpenAI 遇到新问题,因为这些部署在单个连续的超算中包含的硬件数量远超典型客户部署。

探索性 AI 工作流的后端工程

OpenAI 的后端系统旨在支持快节奏、探索性的研究工作流。研究人员常常实现来自最新预印本(例如 arXiv)的新方法,并需要一个平台,使他们能够快速测试这些理论而不受限制。

工程团队的重点包括:

  • 瓶颈识别:预先满足研究需求以防止进展受阻,并为已识别的瓶颈实现快速变通方案。
  • ທີ່ 复杂性管理:管理执行的“倒数第二层”,即在研究者的直观设计与全球最大超算的物理约束之间搭建桥梁。
  • 系统可靠性:实现被动健康检查逻辑,自动将异常硬件从集群中移除,以保持稳定性。

高性能计算(HPC)专长

在 OpenAI 的 HPC 领域工作需要管理在标准后端工程中通常被忽视的底层系统细节。这些优化纯粹由大规模 AI 训练的性能需求驱动,必须针对性地进行。

关键技术关注领域包括:

  • 物理硬件拓扑:优化通信,确保其在同一非统一内存访问(NUMA)域内进行。
  • 直接数据传输:使用 Nvidia 的 GPUDirect,确保 GPU 使用同位的 NVME 或 InfiniBand 设备。
  • CPU 绑定:将系统进程绑定到特定 CPU,以避免与研究运行时的“噪声邻居”冲突。
  • 网络稳定性:调试高吞吐量问题,例如调查因以太网网卡推送超过 30Gbps 导致的内核恐慌。

Sources