guqiong96/Lvllm

LvLLM is a special NUMA extension of vllm that makes full use of CPU and memory resources, reduces GPU memory requirements, and features an efficient GPU parallel and NUMA parallel architecture, supporting hybrid inference for MOE large models.

解決的問題

LvLLM 解決了在執行大型混合專家(MoE)模型時 GPU 的記憶體限制問題。它允許這些模型橫跨 VRAM 與系統記憶體,防止記憶體不足錯誤,並透過利用 CPU 資源進行運算,使在 GPU 記憶體有限的硬體上執行超大型模型成為可能。

工作原理

LvLLM 是 vLLM 的擴展,整合了 lk_moe 引擎。它實現了一種混合平行架構,結合 GPU 平行與 NUMA 感知的 CPU 平行。

關鍵機制包括:

  • 混合記憶體配置:模型權重在 VRAM 與固定 NUMA 主機記憶體之間分散配置。
  • 靈活的層角色:每個 MoE 層可分配為:GPU 本地(所有權重在 VRAM 中)、CPU 混合(權重在記憶體中,注意力在 VRAM 中)、或 GPU 預填(大批次在 GPU,小批次在 CPU)。
  • 計算模式:支援三種模式——CPU-GPU 混合解碼、混合預填、純 GPU 預填,以最大化 GPU 使用率。
  • NUMA 優化:使用 NUMA 線程繫結與交錯,最小化跨節點通訊並提升 L3 快取命中率。

適用對象

專為需要在 VRAM 有限但具備強大多路 CPU/NUMA 配置的系統上優化推理效能的開發者與研究人員設計,適用於部署大型 MoE 模型(如 DeepSeek-V4、Qwen3 或 MiniMax)的場景。

主要亮點

  • VRAM + 系統記憶體擴展:實現「1+1=2」的記憶體佔用,使模型可充分利用 100% 的可用 VRAM 與系統記憶體。
  • NUMA 感知排程:將跨節點通訊降低至最低 3%。
  • 廣泛量化支援:相容 FP8、NVFP4、MXFP4 與 AWQ 4 位對稱量化。
  • vLLM 兼容性:與上游 vLLM 的差異極小,當停用混合功能時,仍保持與原生行為的相容性。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案