MoonshotAI/checkpoint-engine

Checkpoint-engine is a simple middleware to update model weights in LLM inference engines

What it solves

Checkpoint Engine 是一个中间件,旨在高效地更新 LLM 推理引擎中的模型权重。这在强化学习工作流中尤为关键,因为模型权重必须频繁且快速地在大规模 GPU 集群上更新,而不会中断服务。

How it works

它利用一个 ParameterServer 类与推理引擎同址部署,通过两种主要方法管理权重更新:

  • Broadcast:最快的方法,用于在多个实例之间同步更新。它使用三阶段流程(Host 到 Device 的传输、通过 CUDA IPC 缓冲区在工作者之间广播、以及重新加载到推理引擎),并以流水线方式重叠通信和拷贝。
  • P2P:用于动态扩展,例如新增或重启实例时。它使用 mooncake-transfer-engine 从现有实例的 CPU 将权重发送到新实例的 GPU,优化 bucket 分配以最大化网络带宽。

Who it’s for

它面向开发者和研究人员,尤其是使用超大规模 LLM(如 1 万亿参数)以及 vLLM、SGLang 等分布式推理框架,需要高性能、就地权重更新的场景。

Highlights

  • Extreme Scale:能够在约 20 秒内在数千块 GPU 上更新 1 万亿参数模型。
  • Flexible Update Paths:同时支持同步广播和异步 P2P 传输,以满足动态可用性需求。
  • Hardware Support:兼容 NVIDIA GPU(CUDA)和 Intel XPU(通过 SYCL IPC 内存)。
  • Framework Integration:已集成到 vLLM 和 SGLang,减少模型加载和更新时间。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目