Tencent-Hunyuan/HunyuanVideo-1.5
HunyuanVideo-1.5: A leading lightweight video generation model
What it solves
HunyuanVideo-1.5는 개발자와 크리에이터의 계산 장벽을 낮추면서 고품질 비디오 합성을 제공하도록 설계된 경량 비디오 생성 모델입니다. 소비자용 GPU에서도 전문가 수준의 비디오를 생성할 수 있어, 대규모 산업용 하드웨어 없이도 효율적이고 고해상도 비디오 제작이 가능하도록 합니다.
How it works
이 프로젝트는 83억 파라미터 Diffusion Transformer(DiT)와 3D 인과 VAE를 결합해 공간·시간 압축을 효율화합니다. Selective and Sliding Tile Attention(SSTA) 메커니즘을 사용해 중복 데이터를 제거하고 추론 속도를 가속화합니다. 품질 향상을 위해 출력 영상을 1080p로 업스케일하는 비디오 초해상도(VSR) 네트워크도 포함합니다. 모델은 텍스트‑투‑비디오(T2V)와 이미지‑투‑비디오(I2V) 생성을 모두 지원하며, 단계 증류(step‑distillation)를 통해 생성 속도를 추가로 최적화할 수 있습니다.
Who it’s for
최소 14GB GPU 메모리를 갖춘 접근 가능한 하드웨어에서 고품질 비디오를 생성하고자 하는 개발자, AI 연구자, 디지털 크리에이터를 위한 모델이며, ComfyUI 또는 Diffusers와 같은 도구를 통해 자체 애플리케이션에 비디오 생성을 통합하려는 경우에도 적합합니다.
Highlights
- Consumer-Grade Accessibility: 모델 오프로드를 활용해 14GB VRAM만으로 NVIDIA GPU에서 실행 가능.
- High-Performance Architecture: SSTA를 사용해 720p 비디오 합성에서 큰 속도 향상을 달성.
- Flexible Generation: 다양한 해상도에서 텍스트‑투‑비디오와 이미지‑투‑비디오 워크플로를 지원.
- Advanced Optimizations: FP8 GEMM, 캐시 추론(DeepCache, TeaCache, TaylorCache) 및 단계 증류 모델을 포함해 빠른 생성이 가능.
- Super-Resolution: 몇 단계 네트워크를 통합해 비디오를 1080p로 업스케일, 선명도와 텍스처를 개선합니다.