Wan-Video/Wan2.2

Wan: Open and Advanced Large-Scale Video Generative Models

해결하는 문제

Wan2.2는 텍스트, 이미지, 또는 음성에서 고품질의 영화 수준의 영상을 생성하기 위해 설계된 대규모 영상 생성 모델의 세트입니다. 복잡한 움직임, 정밀한 미적 제어, 고해상도(최대 720P)를 유지하면서도 계산 효율성을 확보하는 문제를 해결합니다.

작동 방식

이 프로젝트는 영상 확산 모델에 Mixture-of-Experts (MoE) 아키텍처를 사용하여, 계산 비용을 증가시키지 않고도 다양한 노이즈 제거 타임스텝에 특화된 전문 전문가 모델을 활용함으로써 모델 용량을 증가시킵니다. 대규모 이미지 및 영상 데이터셋, 특히 조명과 구성에 대한 정교하게 셀렉션된 미적 데이터를 기반으로 훈련되었습니다. 고효율 생성을 위해 16x16x4 압축 비율을 가진 전용 VAE를 사용합니다.

대상 사용자

AI 영상 생성 분야의 연구자 및 개발자, 그리고 고해상도 영화적 영상 합성 도구를 필요로 하는 산업용 창작자에게 적합합니다. 고성능 GPU뿐 아니라 RTX 4090과 같은 일반 소비자용 하드웨어에서도 실행 가능합니다.

주요 특징

  • 다중 모달 입력: 텍스트에서 영상(T2V), 이미지에서 영상(I2V), 텍스트-이미지에서 영상(TI2V), 음성에서 영상(S2V) 생성을 지원합니다.
  • 영화적 제어: 조명, 색조, 구성에 대한 세부 레이블을 통해 정밀한 미적 맞춤이 가능합니다.
  • 효율적인 고해상도: 5B 모델은 일반 소비자용 그래픽 카드에서 720P@24fps 생성을 가능하게 합니다.
  • 고급 애니메이션: 캐릭터 애니메이션 및 교체를 위한 전용 모델을 포함하며, 전반적인 움직임을 정확히 재현합니다.
  • 확장 가능한 추론: PyTorch FSDP 및 DeepSpeed Ulysses를 사용하여 단일 GPU 및 멀티 GPU 추론을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트