MiniMax H3 vLLM-Omni를 활용한 FastH3 실시간 서빙
MiniMax H3는 이제 실시간으로 서빙될 수 있습니다: vLLM‑Omni의 시스템 전반 최적화와 FastVideo의 4단계 FastH3 학생 모델이 결합되어 종료에서 종료까지의 지연 시간을 미디어 재생 시간 이하로 낮추어, 8× B300 GPU 노드에서 10초 미만의 MP4 생성이 가능하게 했습니다.
왜 MiniMax H3 서빙은 시스템 전반의 문제인가?
MiniMax H3는 텍스트, 이미지, 비디오 및 오디오 참조로부터 동기화된 비디오와 오디오를 생성하며, 대규모 Qwen3‑VL 인코더, 긴 시퀀스 오디오-비디오 DiT, 별도의 비디오 및 오디오 VAE, 마지막으로 H.264/AAC MP4 구성 단계를 거칩니다. 각 단계는 고유한 계산, 메모리, 배치 요구 사항을 가지므로, 오직 DiT만 최적화하는 것은 인코더, VAE 디코딩, 데이터 전송, MP4 멀티플렉싱 단계에서 여전히 큰 지연을 남깁니다.
vLLM‑Omni의 시스템 전반 최적화
vLLM‑Omni는 전체 주거 파이프라인을 재구성합니다:
- 긴 시퀀스 어텐션 및 통신 – 패킹된 시퀀스 정제는 패딩을 제거하고, 랭크-로컬 경계는 데이터 이동을 제한하며, Fast Ulysses는 NCCL SymmetricMemory를 사용하여 추가적인 all-to-all 재배치를 피합니다.
- 융합된 DiT 연산자 – RMSNorm, RoPE, 조절, 정규화, SwiGLU가 더 적은 커널 실행으로 융합되어, 각 전방향 처리의 오버헤드를 줄입니다.
- 병렬 및 융합된 VAE 디코딩 – 타일 기반 비디오 VAE 디코딩은 8개 GPU에 분산되며, 융합된 Q/K 정규화와 SwiGLU를 사용하고, 오디오 VAE도 동일한 경로를 따릅니다.
- GPU 출력 준비, 전송 및 MP4 생성 – 디코딩된 FP32 프레임은 한 번만 연속적인 uint8로 변환되며, 핀ned D2H/IPC를 통해 전송되며, H.264를 생성하는 지속적인 병렬 컨버터가 RGB 버퍼를 재구성하지 않고 직접 공급합니다.
이러한 변경으로 동일한 8× B300 하드웨어에서 완전 응답 지연 시간이 Diffusers의 82.239 s에서 56.917 s로 감소하여 30.8 % 감소(1.445배 속도 향상)했습니다.
FastH3: 4단계 학생 모델이 주요 DiT 루프를 줄입니다
FastVideo의 FastH3는 기본 MiniMax H3 스케줄의 49번의 DiT 전방향을 다섯 개의 시그마 위치에서 단 4번의 전방향으로 대체합니다. 결과적으로 로드 시점에 융합된 학생 모델(전체 랭크 델타 + 낮은 랭크 어댑터)이 생성되며, vLLM‑Omni는 이를 검증하고 분할하여 최적화된 어텐션, VAE, MP4 경로와 함께 서빙합니다.
FastH3 서빙 구성
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
VLLM_WORKER_MULTIPROC_METHOD=spawn \
VLLM_OMNI_VIDEO_SYNC_TIMEOUT=1800 \
vllm serve "$H3_MODEL" --omni \
--host 127.0.0.1 --port 8095 --trust-remote-code \
--task-type fl2va --served-model-name MiniMaxAI/MiniMax-H3 \
--num-gpus 8 --usp 8 --ring 1 --ulysses-a2a-permute \
--text-encoder-tp-size 8 \
--vae-patch-parallel-size 8 --vae-parallel-mode tile --vae-use-tiling \
--diffusion-attention-backend TRTLLM_ATTN \
--lora-path "$FASTH3_DIR/dense-datafree/adapter_model.safetensors"
단일 FastH3 복제본은 시드 1101로 10초, 1344×768, 24 FPS 요청을 처리합니다.
B300에서의 실시간 FastH3 결과
8GPU B300 노드에서 측정된 핵심 경로는 다음과 같습니다:
| 단계 | 시간 (s) |
|---|---|
| 인코더 (FP32→uint8) | 0.052 |
| DiT 전체 (4번 전방향) | 5.532 (1회당 1.383) |
| 비디오 + 오디오 VAE 디코딩 | 1.247 |
| 전송 및 CPU MP4 멀티플렉싱 | 1.749 |
| 정리된 종료에서 종료까지 | 8.678 – 8.710 |
생성된 10초 비디오의 재생 지속 시간은 10.125 s이며, 클라이언트 실시간 요인(RTF)은 0.86입니다. 즉, 전체 MP4가 재생되는 것보다 빠르게 준비됩니다.
지속 시간 스윕
| 요청된 지속 시간 | 정리된 E2E (s) | 클라이언트 RTF | 실시간 요인 |
|---|---|---|---|
| 5 s (124프레임) | 4.602 – 4.396 | 0.889 – 0.849 | 1.125 – 1.177 |
| 10 s (243프레임) | 8.678 – 8.710 | 0.857 – 0.860 | 1.163 – 1.167 |
| 15 s (362프레임) | 14.177 – 14.059 | 0.940 – 0.932 | 1.064 – 1.073 |
모든 6회 실행이 RTF ≤ 1.0을 충족하여, 5초, 10초, 15초 비디오에 걸쳐 실시간 생성이 가능함을 확인했습니다. |
품질 및 호환성 참고 사항
- FastH3는 전용 T2VA 학생 모델이며, FL2VA, Ref2VA, 요청 시점 LoRA 어댑터를 지원하지 않습니다.
- FastH3는 로드 시점에 학생 모델의 가중치가 융합되므로, 분산 계층 오프로드(DLO) 또는 인코더 분리와 함께 사용할 수 없습니다.
- 미디어 검증 체크에는 올바른 프레임 수, H.264 비디오, 32 kHz 스테레오 AAC 오디오, 0이 아닌 비디오 분산, 오디오 RMS가 포함됩니다. 동일한 시드로 반복 실행 시 바이트 수준 동일 출력이 관찰되었습니다.
- 매칭된 기본 모델 대비 FastH3의 다중 시드 품질 비교는 아직 진행 중이며, 동등성 주장은 하지 않습니다.
FastH3 프로파일을 넘어서는 확장성
vLLM‑Omni는 또한 다음을 지원합니다:
- 분산 계층 오프로드(DLO) – 호스트 메모리에서 DiT 계층을 스트리밍하여 GPU 메모리를 줄이되, 약간의 지연 증가를 수반합니다.
- 분리된 인코더 – Qwen3‑VL 인코더를 독립적인 단계로 실행하여 인코더 용량을 별도로 확장할 수 있습니다.
- 양자화 경로 – 온라인 FP8은 피크 HBM을 약 39 % 줄이며, 5 %의 지연 향상이 가능합니다. SVDQuant(NVFP4 W4A4)도 사용 가능하지만, 융합 커널이 부족합니다.
- 희소 및 양자화된 어텐션 – TRTLLM_ATTN SAGE FP8 및 Skip‑Softmax는 기본 H3 파이프라인에서 최대 1.24배의 속도 향상을 제공하며, LPIPS 품질에 미미한 영향을 미칩니다.
이 옵션들은 FastH3와 독립적이며 별도로 검증되어야 하며, 보고된 FastH3 지연 수치에는 사용되지 않았습니다.
생산 환경 가이드라인
| 필요 사항 | 추천 구성 |
|---|---|
| 전체 작업 커버리지 (T2VA, FL2VA, Ref2VA) | vLLM‑Omni 시스템 전반 스택과 함께 기본 MiniMax H3 |
| 요청 시점 어댑터 전환 또는 4번 전방향 속도를 갖춘 FL2VA | 별도의 터보 서비스(LoRA 기반) |
| T2VA에 대한 최저 검증 지연 시간 | 섹션 4에 설명된 전용 FastH3 서비스 |
| 메모리 제약 환경 배포 | DLO 또는 분리된 인코더와 함께 기본 H3 |
FastH3를 DLO, VSA 변형, 또는 인코더 분리와 함께 사용할 경우, 새로운 정확성 및 지연 검증 없이 혼용하지 마십시오.
라이선스 및 법적 고려 사항
MiniMax H3는 MiniMax H3 커뮤니티 라이선스 계약에 따라 배포됩니다. 상용 또는 호스팅 배포를 계획하는 운영자는 법적 자문을 통해 지역, 출처 표시, 수익, 허용 사용 및 보호 조건을 검토해야 합니다.
참고 자료
- vLLM‑Omni 저장소 – https://github.com/vllm-project/vllm-omni
- FastVideo FastH3 미리보기 – https://haoailab.com/blogs/fasth3-preview/
- MiniMax H3 모델 카드 – https://huggingface.co/MiniMaxAI/MiniMax-H3
- Diffusers MiniMax H3 파이프라인 – https://huggingface.co/docs/diffusers/main/en/api/pipelines/minimax_h3
- 분산 계층 오프로드 블로그 – https://vllm.ai/blog/2026-08-17-distributed-layerwise-offload