Tencent-Hunyuan/HunyuanVideo-I2V

HunyuanVideo-I2V: A Customizable Image-to-Video Model based on HunyuanVideo

What it solves

HunyuanVideo-I2V는 이미지‑투‑비디오 생성 프레임워크로, 단일 레퍼런스 이미지와 텍스트 프롬프트만으로 고품질 비디오(최대 720p, 129 프레임)를 만들 수 있습니다. 레퍼런스 이미지와 생성된 비디오의 첫 프레임 사이의 시각적 일관성을 유지하는 문제를 해결하며, LoRA 학습을 통해 커스터마이징 가능한 효과도 제공합니다.

How it works

시스템은 토큰 교체 기법을 사용해 레퍼런스 이미지 정보를 HunyuanVideo 아키텍처에 통합합니다. 사전 학습된 멀티모달 대규모 언어 모델(MLLM)을 Decoder‑Only 구조의 텍스트 인코더로 활용합니다. MLLM은 입력 이미지를 의미론적 이미지 토큰으로 변환하고, 이를 비디오 잠재 토큰과 연결합니다. 이를 통해 모델은 이미지와 텍스트 두 모달리티에 대해 전체 어텐션 연산을 수행하여, 생성된 비디오가 입력 이미지와 캡션과 의미적으로 일치하도록 합니다.

Who it’s for

이 도구는 정적 이미지에서 시네마틱 비디오를 생성하고자 하는 AI 연구자, 개발자, 크리에이터와 LoRA를 이용해 맞춤형 비디오 효과를 학습하고자 하는 사람들을 위해 설계되었습니다.

Highlights

  • High Resolution: 최대 720p 해상도의 비디오 생성 지원.
  • Visual Consistency: 비디오 첫 프레임이 레퍼런스 이미지와 충실하도록 최적화.
  • Customizable Effects: LoRA 학습 스크립트를 포함해 특정 비디오 효과(예: 머리카락 성장 또는 포옹)를 만들 수 있음.
  • Parallel Inference: xDiT를 통한 다중 GPU 시퀀스 병렬 추론을 지원해 생성 속도 향상.
  • Flexible Dynamics: 안정적인 비디오 생성과 고다이내믹 움직임 사이를 전환할 수 있는 설정 제공.