MiniMax H3 vLLM-Omni를 활용한 FastH3 실시간 서빙

MiniMax H3는 이제 실시간으로 서빙될 수 있습니다: vLLM‑Omni의 시스템 전반 최적화와 FastVideo의 4단계 FastH3 학생 모델이 결합되어 종료에서 종료까지의 지연 시간을 미디어 재생 시간 이하로 낮추어, 8× B300 GPU 노드에서 10초 미만의 MP4 생성이 가능하게 했습니다.


왜 MiniMax H3 서빙은 시스템 전반의 문제인가?

MiniMax H3는 텍스트, 이미지, 비디오 및 오디오 참조로부터 동기화된 비디오와 오디오를 생성하며, 대규모 Qwen3‑VL 인코더, 긴 시퀀스 오디오-비디오 DiT, 별도의 비디오 및 오디오 VAE, 마지막으로 H.264/AAC MP4 구성 단계를 거칩니다. 각 단계는 고유한 계산, 메모리, 배치 요구 사항을 가지므로, 오직 DiT만 최적화하는 것은 인코더, VAE 디코딩, 데이터 전송, MP4 멀티플렉싱 단계에서 여전히 큰 지연을 남깁니다.

vLLM‑Omni의 시스템 전반 최적화

vLLM‑Omni는 전체 주거 파이프라인을 재구성합니다:

  • 긴 시퀀스 어텐션 및 통신 – 패킹된 시퀀스 정제는 패딩을 제거하고, 랭크-로컬 경계는 데이터 이동을 제한하며, Fast Ulysses는 NCCL SymmetricMemory를 사용하여 추가적인 all-to-all 재배치를 피합니다.
  • 융합된 DiT 연산자 – RMSNorm, RoPE, 조절, 정규화, SwiGLU가 더 적은 커널 실행으로 융합되어, 각 전방향 처리의 오버헤드를 줄입니다.
  • 병렬 및 융합된 VAE 디코딩 – 타일 기반 비디오 VAE 디코딩은 8개 GPU에 분산되며, 융합된 Q/K 정규화와 SwiGLU를 사용하고, 오디오 VAE도 동일한 경로를 따릅니다.
  • GPU 출력 준비, 전송 및 MP4 생성 – 디코딩된 FP32 프레임은 한 번만 연속적인 uint8로 변환되며, 핀ned D2H/IPC를 통해 전송되며, H.264를 생성하는 지속적인 병렬 컨버터가 RGB 버퍼를 재구성하지 않고 직접 공급합니다.

이러한 변경으로 동일한 8× B300 하드웨어에서 완전 응답 지연 시간이 Diffusers의 82.239 s에서 56.917 s로 감소하여 30.8 % 감소(1.445배 속도 향상)했습니다.

FastH3: 4단계 학생 모델이 주요 DiT 루프를 줄입니다

FastVideo의 FastH3는 기본 MiniMax H3 스케줄의 49번의 DiT 전방향을 다섯 개의 시그마 위치에서 단 4번의 전방향으로 대체합니다. 결과적으로 로드 시점에 융합된 학생 모델(전체 랭크 델타 + 낮은 랭크 어댑터)이 생성되며, vLLM‑Omni는 이를 검증하고 분할하여 최적화된 어텐션, VAE, MP4 경로와 함께 서빙합니다.

FastH3 서빙 구성

CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
VLLM_WORKER_MULTIPROC_METHOD=spawn \
VLLM_OMNI_VIDEO_SYNC_TIMEOUT=1800 \
vllm serve "$H3_MODEL" --omni \
  --host 127.0.0.1 --port 8095 --trust-remote-code \
  --task-type fl2va --served-model-name MiniMaxAI/MiniMax-H3 \
  --num-gpus 8 --usp 8 --ring 1 --ulysses-a2a-permute \
  --text-encoder-tp-size 8 \
  --vae-patch-parallel-size 8 --vae-parallel-mode tile --vae-use-tiling \
  --diffusion-attention-backend TRTLLM_ATTN \
  --lora-path "$FASTH3_DIR/dense-datafree/adapter_model.safetensors"

단일 FastH3 복제본은 시드 1101로 10초, 1344×768, 24 FPS 요청을 처리합니다.

B300에서의 실시간 FastH3 결과

8GPU B300 노드에서 측정된 핵심 경로는 다음과 같습니다:

단계 시간 (s)
인코더 (FP32→uint8) 0.052
DiT 전체 (4번 전방향) 5.532 (1회당 1.383)
비디오 + 오디오 VAE 디코딩 1.247
전송 및 CPU MP4 멀티플렉싱 1.749
정리된 종료에서 종료까지 8.678 – 8.710

생성된 10초 비디오의 재생 지속 시간은 10.125 s이며, 클라이언트 실시간 요인(RTF)은 0.86입니다. 즉, 전체 MP4가 재생되는 것보다 빠르게 준비됩니다.

지속 시간 스윕

요청된 지속 시간 정리된 E2E (s) 클라이언트 RTF 실시간 요인
5 s (124프레임) 4.602 – 4.396 0.889 – 0.849 1.125 – 1.177
10 s (243프레임) 8.678 – 8.710 0.857 – 0.860 1.163 – 1.167
15 s (362프레임) 14.177 – 14.059 0.940 – 0.932 1.064 – 1.073
모든 6회 실행이 RTF ≤ 1.0을 충족하여, 5초, 10초, 15초 비디오에 걸쳐 실시간 생성이 가능함을 확인했습니다.

품질 및 호환성 참고 사항

  • FastH3는 전용 T2VA 학생 모델이며, FL2VA, Ref2VA, 요청 시점 LoRA 어댑터를 지원하지 않습니다.
  • FastH3는 로드 시점에 학생 모델의 가중치가 융합되므로, 분산 계층 오프로드(DLO) 또는 인코더 분리와 함께 사용할 수 없습니다.
  • 미디어 검증 체크에는 올바른 프레임 수, H.264 비디오, 32 kHz 스테레오 AAC 오디오, 0이 아닌 비디오 분산, 오디오 RMS가 포함됩니다. 동일한 시드로 반복 실행 시 바이트 수준 동일 출력이 관찰되었습니다.
  • 매칭된 기본 모델 대비 FastH3의 다중 시드 품질 비교는 아직 진행 중이며, 동등성 주장은 하지 않습니다.

FastH3 프로파일을 넘어서는 확장성

vLLM‑Omni는 또한 다음을 지원합니다:

  • 분산 계층 오프로드(DLO) – 호스트 메모리에서 DiT 계층을 스트리밍하여 GPU 메모리를 줄이되, 약간의 지연 증가를 수반합니다.
  • 분리된 인코더 – Qwen3‑VL 인코더를 독립적인 단계로 실행하여 인코더 용량을 별도로 확장할 수 있습니다.
  • 양자화 경로 – 온라인 FP8은 피크 HBM을 약 39 % 줄이며, 5 %의 지연 향상이 가능합니다. SVDQuant(NVFP4 W4A4)도 사용 가능하지만, 융합 커널이 부족합니다.
  • 희소 및 양자화된 어텐션 – TRTLLM_ATTN SAGE FP8 및 Skip‑Softmax는 기본 H3 파이프라인에서 최대 1.24배의 속도 향상을 제공하며, LPIPS 품질에 미미한 영향을 미칩니다.

이 옵션들은 FastH3와 독립적이며 별도로 검증되어야 하며, 보고된 FastH3 지연 수치에는 사용되지 않았습니다.

생산 환경 가이드라인

필요 사항 추천 구성
전체 작업 커버리지 (T2VA, FL2VA, Ref2VA) vLLM‑Omni 시스템 전반 스택과 함께 기본 MiniMax H3
요청 시점 어댑터 전환 또는 4번 전방향 속도를 갖춘 FL2VA 별도의 터보 서비스(LoRA 기반)
T2VA에 대한 최저 검증 지연 시간 섹션 4에 설명된 전용 FastH3 서비스
메모리 제약 환경 배포 DLO 또는 분리된 인코더와 함께 기본 H3

FastH3를 DLO, VSA 변형, 또는 인코더 분리와 함께 사용할 경우, 새로운 정확성 및 지연 검증 없이 혼용하지 마십시오.

라이선스 및 법적 고려 사항

MiniMax H3는 MiniMax H3 커뮤니티 라이선스 계약에 따라 배포됩니다. 상용 또는 호스팅 배포를 계획하는 운영자는 법적 자문을 통해 지역, 출처 표시, 수익, 허용 사용 및 보호 조건을 검토해야 합니다.


참고 자료

Sources