kvcache-ai/Mooncake

Mooncake is the serving platform for Kimi, a leading LLM service provided by Moonshot AI.

解決的問題

Mooncake 解決了大規模 LLM 服務中的效率瓶頸,特別是 KVCache 管理成本高昂以及異構硬體間資料移動的性能差距。透過建立去耦的 KV 快取池,解決 GPU 集群中 CPU、DRAM 和 SSD 資源未被充分利用的問題,使預填入(prefill)與解碼(decode)叢集得以分離,進而提升吞吐量並降低延遲。

工作原理

Mooncake 採用以 KVCache 為中心的去耦架構,主要包含三個核心元件:

  1. Transfer Engine (TE):高性能框架,為跨多種網路(TCP、RDMA、AWS EFA)與加速器(CUDA、ROCm、Ascend 等)的批次資料移動提供統一介面,利用拓撲感知路由與多網卡頻寬聚合技術。
  2. Mooncake Store:分散式鍵值儲存引擎,用於跨叢集管理可重複使用的 KV 快取與模型權重。採用多層快取階層結構(DRAM 與 SSD/NVMe),支援零複製資料傳輸以最大化頻寬。
  3. Mooncake EP & PG:面向 MoE(專家混合)推論的容錯分散式執行層,提供專家平行調度與相容 PyTorch 的程序群後端,可在不重新啟動整個服務的情況下恢復失敗的程序。

適用對象

專為大規模 LLM 推論與訓練基礎設施的開發者與運維人員設計,尤其適用於在多節點 GPU 叢集上部署超大規模模型(如 MoE 模型)並需最大化硬體利用率、同時滿足嚴格服務等級目標(SLO)的使用者。

核心亮點

  • 高頻寬資料傳輸:在 8x400 Gbps RoCE 網路中實現高達 190 GB/s 的傳輸速率,遠超標準 TCP。
  • 去耦儲存:將 KVCache 儲存與推論引擎解耦,使儲存節點可獨立於引擎重啟或升級進行擴展。
  • 容錯 MoE 服務:支援 MoE 推論在失敗節點間自動路由,並彈性恢復程序。
  • 廣泛生態整合:深度整合 vLLM、SGLang、TensorRT-LLM 與 PyTorch 生態系統。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案