MoonshotAI/checkpoint-engine
Checkpoint-engine is a simple middleware to update model weights in LLM inference engines
What it solves
Checkpoint Engine 是一個中介層,旨在高效地更新 LLM 推論引擎中的模型權重。這在強化學習工作流程中尤為關鍵,因為模型權重必須頻繁且快速地在大規模 GPU 叢集上更新,而不會中斷服務。
How it works
它利用一個 ParameterServer 類別與推論引擎同址部署,透過兩種主要方法管理權重更新:
- Broadcast:最快的方法,用於在多個實例之間同步更新。它使用三階段流程(Host 到 Device 的傳輸、透過 CUDA IPC 緩衝區在工作者之間廣播、以及重新載入到推論引擎),並以管線化方式重疊通信與拷貝。
- P2P:用於動態擴展,例如新增或重新啟動實例時。它使用
mooncake-transfer-engine從現有實例的 CPU 將權重傳送至新實例的 GPU,並優化 bucket 分配以最大化網路頻寬。
Who it’s for
此工具適用於開發者與研究人員,特別是使用超大規模 LLM(例如 1 兆參數)以及 vLLM、SGLang 等分散式推論框架,需要高效即時權重更新的情境。
Highlights
- Extreme Scale:能在約 20 秒內於上千顆 GPU 上更新 1 兆參數模型。
- Flexible Update Paths:同時支援同步廣播與非同步 P2P 傳輸,以因應動態可用性需求。
- Hardware Support:相容於 NVIDIA GPU(CUDA)與 Intel XPU(透過 SYCL IPC 記憶體)。
- Framework Integration:已整合至 vLLM 與 SGLang,減少模型載入與更新時間。
相關
- 專案
- 專案
- 專案
- 專案
- 專案