kvcache-ai/Mooncake
Mooncake is the serving platform for Kimi, a leading LLM service provided by Moonshot AI.
解决的问题
Mooncake 解决了大规模 LLM 服务中的效率瓶颈,特别是 KVCache 管理成本高昂以及异构硬件间数据移动性能差距的问题。通过构建去耦的 KV 缓存池,解决了 GPU 集群中 CPU、DRAM 和 SSD 资源利用率低下的问题,使预填充(prefill)和解码(decode)集群可以分离,从而提升吞吐量并降低延迟。
工作原理
Mooncake 采用以 KVCache 为中心的去耦架构,主要包括三个核心组件:
- Transfer Engine (TE):高性能框架,为跨多种网络(TCP、RDMA、AWS EFA)和加速器(CUDA、ROCm、Ascend 等)的批量数据移动提供统一接口,利用拓扑感知路由和多网卡带宽聚合技术。
- Mooncake Store:分布式键值存储引擎,用于跨集群管理可复用的 KV 缓存和模型权重。采用多级缓存层次结构(DRAM 和 SSD/NVMe),支持零拷贝数据传输以最大化带宽。
- Mooncake EP & PG:面向 MoE(专家混合)推理的容错分布式执行层,提供专家并行调度和兼容 PyTorch 的进程组后端,可在不重启整个服务的情况下恢复失败的进程。
适用对象
专为大规模 LLM 推理与训练基础设施的开发者和运维人员设计,尤其适用于在多节点 GPU 集群上部署超大规模模型(如 MoE 模型)并需要最大化硬件利用率、同时满足严格服务等级目标(SLO)的用户。
核心亮点
- 高带宽数据传输:在 8x400 Gbps RoCE 网络中实现高达 190 GB/s 的传输速率,远超标准 TCP。
- 去耦存储:将 KVCache 存储与推理引擎解耦,使存储节点可独立于引擎重启或升级进行扩展。
- 容错 MoE 服务:支持 MoE 推理在失败节点间自动路由,并弹性恢复进程。
- 广泛生态集成:深度集成 vLLM、SGLang、TensorRT-LLM 和 PyTorch 生态系统。
相关
- Dispatch
- 项目
- 项目
- 项目