MoonshotAI/checkpoint-engine
Checkpoint-engine is a simple middleware to update model weights in LLM inference engines
What it solves
Checkpoint Engine 是一个中间件,旨在高效地更新 LLM 推理引擎中的模型权重。这在强化学习工作流中尤为关键,因为模型权重必须频繁且快速地在大规模 GPU 集群上更新,而不会中断服务。
How it works
它利用一个 ParameterServer 类与推理引擎同址部署,通过两种主要方法管理权重更新:
- Broadcast:最快的方法,用于在多个实例之间同步更新。它使用三阶段流程(Host 到 Device 的传输、通过 CUDA IPC 缓冲区在工作者之间广播、以及重新加载到推理引擎),并以流水线方式重叠通信和拷贝。
- P2P:用于动态扩展,例如新增或重启实例时。它使用
mooncake-transfer-engine从现有实例的 CPU 将权重发送到新实例的 GPU,优化 bucket 分配以最大化网络带宽。
Who it’s for
它面向开发者和研究人员,尤其是使用超大规模 LLM(如 1 万亿参数)以及 vLLM、SGLang 等分布式推理框架,需要高性能、就地权重更新的场景。
Highlights
- Extreme Scale:能够在约 20 秒内在数千块 GPU 上更新 1 万亿参数模型。
- Flexible Update Paths:同时支持同步广播和异步 P2P 传输,以满足动态可用性需求。
- Hardware Support:兼容 NVIDIA GPU(CUDA)和 Intel XPU(通过 SYCL IPC 内存)。
- Framework Integration:已集成到 vLLM 和 SGLang,减少模型加载和更新时间。
相关
- 项目
- 项目
- 项目
- 项目
- 项目