OpenVDN/vdn-minimax-h3
VideoDeltaNet-H3: Live T2VA / I2VA / FL2VA generation based on Minimax H3.
VDN-Minimax-H3란 무엇인가요?
VDN-H3 (Video DeltaNet on MiniMax H3)는 MiniMax H3 백본을 기반으로 구축된 하이브리드 어텐션 비디오 확산 모델입니다. 경량 선형 어텐션 브랜치와 몇 개의 LoRA 어댑터를 추가하여, 시각적 품질을 원래의 밀집 모델과 유사하게 유지하면서도 14초, 768p 비디오를 실시간보다 빠르게 생성할 수 있습니다.
핵심 아이디어
| 아이디어 | 중요성 | |------|----------------|| | Hybrid architecture | 한 브랜치는 속도를 위해 저렴한 선형 어텐션을 사용하고, 다른 브랜치는 품질과 시간적 일관성을 위해 전체 softmax 어텐션 브랜치를 유지합니다. | | Plug-and-play LoRA adapters | 추가된 선형 브랜치와 두 개의 작은 LoRA 모듈은 추론 시점에 병합되므로, 원래의 MiniMax 가중치를 건드리지 않습니다. | | FP8 inference + FlashAttention-4 | 혼합 정밀도 (FP8)와 최신 FlashAttention 커널을 통해 현대적인 NVIDIA H200/B200 GPU에서 최대 3x-5x 속도 향상을 제공합니다. | | Open-source stack | 최적화된 추론 코드와 전체 학습 레시피가 모두 공개되어 있어, 누구나 모델을 재현하거나 미세 조정할 수 있습니다. |
시작하기 (빠른 시작)
- Clone & create a conda env (Python 3.12, PyTorch 2.13+CUDA 12.9).
uv패키지 관리자를 설치하고uv pip install -e .를 실행하여flash-attn-4를 포함한 모든 종속성을 가져옵니다. | - Patch Diffusers – 헬퍼 스크립트 (
scripts/setup_diffusers.sh)가 HuggingFace Diffusers 라이브러리에 필요한 변경 사항을 적용합니다. | - Download the weights (≈ 82 GB)를 HuggingFace CLI로 다운로드합니다:
디렉토리에 MiniMax-H3 베이스 모델 (≈ 72 GB)과 두 개의 VDN-H3 체크포인트 (각 ≈ 4-5 GB)가 포함됩니다. |hf download OpenVDN/vdn-minimax-h3 --local-dir ckpts - Run a single-GPU test:
스크립트는 첫 실행 시 Flash 커널을 컴파일한 후, 8-GPU B200 노드에서 약 11초 만에 8단계 비디오 디노이징을 수행하거나, 단일 B200에서 약 6초가 소요됩니다. |bash scripts/inference/8nfe_tuned_fp8.sh - Render your own prompt – Qwen3-VL-32B VLM으로 텍스트 프롬프트를 인코딩한 후, 추론 스크립트를 호출합니다:
(README에서는 최상의 품질을 위해 MiniMax-H3-Context-IR로 프롬프트를 다시 작성하는 것을 권장합니다.) |python src/inference/encode_prompt.py --prompt "..." --out prompts/mine.pt python src/inference/infer.py \ --config configs/inference/8nfe_tuned_fp8.yaml \ checkpoint=ckpts/stage-dmd-step-250 \ render.prompt_file=prompts/mine.pt \ render.out=results/mine.mp4
성능 수치 (steady-state denoising, 768p, 14.4s video)
| GPU type | #GPUs | Seconds per NFE | 50-step VDN-H3 (≈ 9 min) | 8-step VDN-H3 |
|---|---|---|---|---|
| H200 | 1 | 11.2 | 9.4 min | 90.5s |
| H200 | 8 | 2.29 | 1.9 min | 18.3s |
| B200 | 1 | 6.41 | 5.3 min | 51s |
| B200 | 8 | 1.40 | 1.2 min | 11.23s |
(이 시간은 모델 로딩, warm-up, VAE 디코딩 및 MP4 인코딩을 제외한 수치입니다.) |
Training pipeline
VDN-H3는 동결된 MiniMax-H3 transformer 위에서 four stages로 학습됩니다:
| Stage | What is trained | Steps |
|---|---|---|
| A1 | Linear-attention branch (layer-wise alignment) | 200 |
| A2 | Same branch, end-to-end fine-tune | 500 |
| B | LoRA adapters on QKV/O projections + linear branch | 2000 |
| DMD | 8-step “turbo” LoRA (data-free, initialized from a community LoRA) | 250 |
학습 스크립트는 src/training/ 및 scripts/training/에 있습니다. 데이터는 MiniMax-H3 형식을 따르는 사전 인코딩된 latents (비디오, 오디오, 텍스트)여야 하며, video_index.jsonl이 각 클립의 비디오 latent file을 가리킵니다. |
License & attribution
- Code – Apache 2.0 (see
LICENSE). - Model weights – HuggingFace에서 MiniMax H3 Community License에 따라 별도로 배포됩니다 (Apache 2.0에 포함되지 않음).
- 제공된 BibTeX 항목으로 연구를 인용하십시오. |
TL;DR
VDN-Minimax-H3는 오픈 소스 하이브리드 어텐션 비디오 확산 모델로, MiniMax H3에 빠른 선형 어텐션 브랜치와 작은 LoRA 어댑터를 추가하여 고해상도 비디오의 실시간에 가까운 생성을 달성합니다. 이 저장소는 단일 GPU 또는 8-GPU 클러스터에서 추론을 실행하는 데 필요한 모든 것을 제공하며, 모델을 재현하기 위한 전체 학습 레시피를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트