OpenVDN/vdn-minimax-h3

VideoDeltaNet-H3: Live T2VA / I2VA / FL2VA generation based on Minimax H3.

VDN-Minimax-H3란 무엇인가요?

VDN-H3 (Video DeltaNet on MiniMax H3)는 MiniMax H3 백본을 기반으로 구축된 하이브리드 어텐션 비디오 확산 모델입니다. 경량 선형 어텐션 브랜치와 몇 개의 LoRA 어댑터를 추가하여, 시각적 품질을 원래의 밀집 모델과 유사하게 유지하면서도 14초, 768p 비디오를 실시간보다 빠르게 생성할 수 있습니다.


핵심 아이디어

| 아이디어 | 중요성 | |------|----------------|| | Hybrid architecture | 한 브랜치는 속도를 위해 저렴한 선형 어텐션을 사용하고, 다른 브랜치는 품질과 시간적 일관성을 위해 전체 softmax 어텐션 브랜치를 유지합니다. | | Plug-and-play LoRA adapters | 추가된 선형 브랜치와 두 개의 작은 LoRA 모듈은 추론 시점에 병합되므로, 원래의 MiniMax 가중치를 건드리지 않습니다. | | FP8 inference + FlashAttention-4 | 혼합 정밀도 (FP8)와 최신 FlashAttention 커널을 통해 현대적인 NVIDIA H200/B200 GPU에서 최대 3x-5x 속도 향상을 제공합니다. | | Open-source stack | 최적화된 추론 코드와 전체 학습 레시피가 모두 공개되어 있어, 누구나 모델을 재현하거나 미세 조정할 수 있습니다. |


시작하기 (빠른 시작)

  1. Clone & create a conda env (Python 3.12, PyTorch 2.13+CUDA 12.9). uv 패키지 관리자를 설치하고 uv pip install -e .를 실행하여 flash-attn-4를 포함한 모든 종속성을 가져옵니다. |
  2. Patch Diffusers – 헬퍼 스크립트 (scripts/setup_diffusers.sh)가 HuggingFace Diffusers 라이브러리에 필요한 변경 사항을 적용합니다. |
  3. Download the weights (≈ 82 GB)를 HuggingFace CLI로 다운로드합니다:
    hf download OpenVDN/vdn-minimax-h3 --local-dir ckpts
    
    디렉토리에 MiniMax-H3 베이스 모델 (≈ 72 GB)과 두 개의 VDN-H3 체크포인트 (각 ≈ 4-5 GB)가 포함됩니다. |
  4. Run a single-GPU test:
    bash scripts/inference/8nfe_tuned_fp8.sh
    
    스크립트는 첫 실행 시 Flash 커널을 컴파일한 후, 8-GPU B200 노드에서 약 11초 만에 8단계 비디오 디노이징을 수행하거나, 단일 B200에서 약 6초가 소요됩니다. |
  5. Render your own prompt – Qwen3-VL-32B VLM으로 텍스트 프롬프트를 인코딩한 후, 추론 스크립트를 호출합니다:
    python src/inference/encode_prompt.py --prompt "..." --out prompts/mine.pt
    python src/inference/infer.py \
      --config configs/inference/8nfe_tuned_fp8.yaml \
      checkpoint=ckpts/stage-dmd-step-250 \
      render.prompt_file=prompts/mine.pt \
      render.out=results/mine.mp4
    
    (README에서는 최상의 품질을 위해 MiniMax-H3-Context-IR로 프롬프트를 다시 작성하는 것을 권장합니다.) |

성능 수치 (steady-state denoising, 768p, 14.4s video)

GPU type #GPUs Seconds per NFE 50-step VDN-H3 (≈ 9 min) 8-step VDN-H3
H200 1 11.2 9.4 min 90.5s
H200 8 2.29 1.9 min 18.3s
B200 1 6.41 5.3 min 51s
B200 8 1.40 1.2 min 11.23s

(이 시간은 모델 로딩, warm-up, VAE 디코딩 및 MP4 인코딩을 제외한 수치입니다.) |


Training pipeline

VDN-H3는 동결된 MiniMax-H3 transformer 위에서 four stages로 학습됩니다:

Stage What is trained Steps
A1 Linear-attention branch (layer-wise alignment) 200
A2 Same branch, end-to-end fine-tune 500
B LoRA adapters on QKV/O projections + linear branch 2000
DMD 8-step “turbo” LoRA (data-free, initialized from a community LoRA) 250

학습 스크립트는 src/training/scripts/training/에 있습니다. 데이터는 MiniMax-H3 형식을 따르는 사전 인코딩된 latents (비디오, 오디오, 텍스트)여야 하며, video_index.jsonl이 각 클립의 비디오 latent file을 가리킵니다. |


License & attribution

  • Code – Apache 2.0 (see LICENSE).
  • Model weights – HuggingFace에서 MiniMax H3 Community License에 따라 별도로 배포됩니다 (Apache 2.0에 포함되지 않음).
  • 제공된 BibTeX 항목으로 연구를 인용하십시오. |

TL;DR

VDN-Minimax-H3는 오픈 소스 하이브리드 어텐션 비디오 확산 모델로, MiniMax H3에 빠른 선형 어텐션 브랜치와 작은 LoRA 어댑터를 추가하여 고해상도 비디오의 실시간에 가까운 생성을 달성합니다. 이 저장소는 단일 GPU 또는 8-GPU 클러스터에서 추론을 실행하는 데 필요한 모든 것을 제공하며, 모델을 재현하기 위한 전체 학습 레시피를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트