MoonshotAI/checkpoint-engine

Checkpoint-engine is a simple middleware to update model weights in LLM inference engines

What it solves

Checkpoint Engine 是一個中介層,旨在高效地更新 LLM 推論引擎中的模型權重。這在強化學習工作流程中尤為關鍵,因為模型權重必須頻繁且快速地在大規模 GPU 叢集上更新,而不會中斷服務。

How it works

它利用一個 ParameterServer 類別與推論引擎同址部署,透過兩種主要方法管理權重更新:

  • Broadcast:最快的方法,用於在多個實例之間同步更新。它使用三階段流程(Host 到 Device 的傳輸、透過 CUDA IPC 緩衝區在工作者之間廣播、以及重新載入到推論引擎),並以管線化方式重疊通信與拷貝。
  • P2P:用於動態擴展,例如新增或重新啟動實例時。它使用 mooncake-transfer-engine 從現有實例的 CPU 將權重傳送至新實例的 GPU,並優化 bucket 分配以最大化網路頻寬。

Who it’s for

此工具適用於開發者與研究人員,特別是使用超大規模 LLM(例如 1 兆參數)以及 vLLM、SGLang 等分散式推論框架,需要高效即時權重更新的情境。

Highlights

  • Extreme Scale:能在約 20 秒內於上千顆 GPU 上更新 1 兆參數模型。
  • Flexible Update Paths:同時支援同步廣播與非同步 P2P 傳輸,以因應動態可用性需求。
  • Hardware Support:相容於 NVIDIA GPU(CUDA)與 Intel XPU(透過 SYCL IPC 記憶體)。
  • Framework Integration:已整合至 vLLM 與 SGLang,減少模型載入與更新時間。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案