MoonshotAI/checkpoint-engine

Checkpoint-engine is a simple middleware to update model weights in LLM inference engines

What it solves

Checkpoint Engine 是一个中间件,旨在解决 LLM 推理引擎中模型权重更新缓慢的问题。这在需要频繁且高效地在大型 GPU 集群上更新权重的强化学习工作流中尤为关键,且不会造成显著的停机时间或性能退化。

How it works

它作为与推理引擎同址的 ParameterServer 服务运行,使用两种主要的更新方式:

  • Broadcast:在多个实例之间同步更新的最快方法。它使用三阶段流程(Host-to-Device 传输、通过 CUDA IPC 缓冲区在工作者之间广播、以及由推理引擎重新加载),并以流水线方式重叠通信与复制。
  • P2P:用于动态扩缩或重启。它利用 mooncake-transfer-engine 从现有实例的 CPU 将权重传送至新实例的 GPU,并优化 bucket 分配以最大化网络带宽。

引擎通过收集元数据、规划 bucket 大小,并通过 ZeroMQ socket 控制推理引擎,来协调这些传输。

Who it’s for

它是为使用大规模 LLM(例如 1 万亿参数的 Kimi‑K2)的开发者和研究者而构建,这些用户需要在数千个 GPU 上快速更新权重,特别是使用 vLLM 或 SGLang 作为推理后端的场景。

Highlights

  • Extreme Scale:能够在约 20 秒内于数千个 GPU 上更新 1 万亿参数模型。
  • Flexible Update Modes:同时支持高速同步广播与灵活点对点传输,以应对动态实例可用性。
  • Pipelined Execution:重叠数据传输与内存复制,以最大化 GPU 吞吐量。
  • Framework Integration:提供即插即用的支持与 vLLM、SGLang 的集成路径。