Tencent-Hunyuan/HunyuanVideo

HunyuanVideo: A Systematic Framework For Large Video Generation Model

What it solves

HunyuanVideo는 오픈소스와 클로즈드소스 비디오 생성 사이의 격차를 메우기 위해 설계된 대규모 오픈소스 비디오 기반 모델입니다. 높은 모션 다양성, 정밀한 텍스트‑비디오 정렬, 생성 안정성을 갖춘 고품질 비디오 제작이라는 과제를 해결하며, 주요 상용 모델의 성능에 맞추거나 능가하는 것을 목표로 합니다.

How it works

이 모델은 Causal 3D VAE를 사용한 공간‑시간 압축 잠재 공간에서 작동합니다. "Dual‑stream to Single‑stream" 하이브리드 Transformer 아키텍처를 채택하여 먼저 비디오 토큰과 텍스트 토큰을 독립적으로 처리(dual‑stream)한 뒤, 이를 연결해 멀티모달 융합(single‑stream)을 수행합니다. 텍스트 인코딩에는 사전 학습된 Decoder‑Only Multimodal Large Language Model(MLLM)과 양방향 토큰 리파이너를 결합해 명령 수행 및 상세 설명 능력을 향상시킵니다. 또한, 파인튜닝된 Hunyuan‑Large 모델을 사용해 사용자 프롬프트를 모델이 선호하는 형식으로 재작성함으로써 시각 품질과 의도 이해도를 높입니다.

Who it’s for

고성능 오픈소스 텍스트‑투‑비디오 생성 도구가 필요한 AI 연구자, 개발자, 크리에이터를 위한 모델로, 전문가 수준의 시각 및 모션 품질을 제공합니다.

Highlights

  • Massive Scale: One of the largest open-source video generative models with over 13 billion parameters.
  • Unified Architecture: Uses a hybrid Transformer design to handle both image and video generation.
  • Advanced Text Encoding: Leverages an MLLM instead of standard CLIP/T5 encoders for superior reasoning and alignment.
  • Efficient Compression: Employs a 3D VAE to reduce token counts, enabling training at original resolutions and frame rates.
  • Flexible Inference: Supports single-GPU, multi-GPU parallel inference (via xDiT), and FP8 quantization to reduce memory overhead.