guqiong96/Lvllm

LvLLM is a special NUMA extension of vllm that makes full use of CPU and memory resources, reduces GPU memory requirements, and features an efficient GPU parallel and NUMA parallel architecture, supporting hybrid inference for MOE large models.

何を解決するか

LvLLMは、大規模なMixture-of-Experts(MoE)モデルを実行する際のGPUのメモリ制限に対処します。このモデルはVRAMとシステムメモリの両方を活用して展開可能であり、メモリ不足エラーを回避し、GPUメモリが限られたハードウェア上で大規模モデルを実行できるようにします。CPUリソースを活用して計算を実行します。

動作方法

LvLLMはvLLMの拡張であり、lk_moeエンジンを統合しています。GPU並列処理とNUMA対応CPU並列処理を組み合わせたハイブリッド並列アーキテクチャを実装しています。

主なメカニズム:

  • ハイブリッドメモリ配置:モデルの重みはVRAMとピン止めされたNUMAホストメモリの間で分散配置されます。
  • 柔軟なレイヤー役割:各MoEレイヤーには、GPUに配置(すべての重みがVRAM内)、CPUハイブリッド(重みはメモリ、アテンションはVRAM)、GPUプリフィル(大規模バッチはGPU、小規模はCPU)の役割が割り当てられます。
  • 計算モード:CPU-GPUハイブリッドデコード、ハイブリッドプリフィル、純粋GPUプリフィルの3つのモードをサポートし、GPUの利用効率を最大化します。
  • NUMA最適化:NUMAスレッドバインディングとインタリーブを使用して、ノード間通信を最小限に抑え、L3キャッシュヒット率を向上させます。

対象ユーザー

VRAMが限られているが、強力なマルチソケットCPU/NUMA構成を持つシステム上で大規模MoEモデル(DeepSeek-V4、Qwen3、MiniMaxなど)をデプロイする開発者や研究者向けです。

特徴

  • VRAM + システムメモリスケーリング:「1+1=2」のメモリフットプリントを実現し、利用可能なVRAMとシステムRAMの100%を活用可能にします。
  • NUMA対応スケジューリング:ノード間通信を最大で3%まで削減します。
  • 広範な量子化サポート:FP8、NVFP4、MXFP4、AWQ 4ビット対称量子化に対応しています。
  • vLLM互換性:上流のvLLMとの差分を最小限に抑え、ハイブリッド機能を無効にした場合でも、標準的な動作と互換性を維持します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト