guqiong96/Lvllm
LvLLM is a special NUMA extension of vllm that makes full use of CPU and memory resources, reduces GPU memory requirements, and features an efficient GPU parallel and NUMA parallel architecture, supporting hybrid inference for MOE large models.
해결하는 문제
LvLLM은 대규모 혼합 전문가(MoE) 모델을 실행할 때 GPU의 메모리 제한을 해결합니다. 이는 모델이 VRAM과 시스템 메모리 양쪽을 활용해 확장되도록 하여 메모리 부족 오류를 방지하고, GPU 메모리가 제한된 하드웨어에서도 CPU 리소스를 활용해 대규모 모델을 실행할 수 있게 합니다.
작동 방식
LvLLM은 vLLM의 확장으로, lk_moe 엔진을 통합합니다. GPU 병렬 처리와 NUMA 인식 CPU 병렬 처리를 결합한 하이브리드 병렬 아키텍처를 구현합니다.
주요 메커니즘:
- 하이브리드 메모리 배치: 모델 가중치는 VRAM과 핀된 NUMA 호스트 메모리 사이에 분산 배치됩니다.
- 유연한 레이어 역할: 각 MoE 레이어는 GPU에 존재(모든 가중치가 VRAM에), CPU 하이브리드(가중치는 메모리, 어텐션은 VRAM), GPU 프리필(대규모 배치는 GPU, 소규모는 CPU)로 할당됩니다.
- 계산 모드: CPU-GPU 하이브리드 디코딩, 하이브리드 프리필, 순수 GPU 프리필의 세 가지 모드를 지원하여 GPU 활용도를 극대화합니다.
- NUMA 최적화: NUMA 스레드 바인딩과 인터리빙을 사용해 노드 간 통신을 최소화하고 L3 캐시 히트율을 높입니다.
대상 사용자
VRAM이 제한된 환경에서 강력한 멀티소켓 CPU/NUMA 구성이 있는 시스템에서 대규모 MoE 모델(DeepSeek-V4, Qwen3, MiniMax 등)을 배포하는 개발자 및 연구자에게 적합합니다.
주요 특징
- VRAM + 시스템 메모리 확장성: "1+1=2" 메모리 프로필을 실현하여 사용 가능한 VRAM과 시스템 RAM의 100%를 활용할 수 있습니다.
- NUMA 인식 스케줄링: 노드 간 통신을 최대 3%까지 감소시킵니다.
- 광범위한 양자화 지원: FP8, NVFP4, MXFP4, AWQ 4비트 대칭 양자화와 호환됩니다.
- vLLM 호환성: 상류 vLLM과의 차이를 최소화하여 하이브리드 기능을 비활성화했을 때도 기본 동작과 호환됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트