aigc-apps/VideoX-Fun

📹 A more flexible framework that can generate videos at any resolution and creates videos from images.

해결하는 문제

VideoX-Fun은 고품질 AI 동영상과 이미지를 생성하기 위한 포괄적인 파이프라인을 제공합니다. 사용자가 시작 프레임과 종료 프레임을 지정하거나, 스타일 전이를 위해 참조 동영상을 사용하거나, Canny 에지, 깊이 맵, 인간 자세와 같은 정밀한 구조적 제어를 적용하여 생성 콘텐츠의 움직임과 구성에 대한 가이드를 제공하는 제어 가능한 동영상 생성의 도전 과제를 해결합니다.

작동 방식

이 프로젝트는 Diffusion Transformer (DiT) 아키텍처를 사용하며, 특히 CogVideoX-Fun 및 Wan 2.1 시리즈 모델을 지원합니다. 다음과 같은 여러 생성 모드를 제공합니다:

  • 텍스트에서 동영상 (T2V): 텍스트 프롬프트에서 동영상을 생성합니다.
  • 이미지에서 동영상 (I2V): 시작 프레임과 종료 프레임으로 구성된 하나 또는 두 개의 이미지를 사용하여 장면을 애니메이션화합니다.
  • 동영상에서 동영상 (V2V): 참조 동영상을 사용하여 새로운 동영상을 생성합니다.
  • 제어된 생성: Canny, 포즈, 깊이, MLSD와 같은 특정 조건을 강제하는 제어 모델을 사용하며, 카메라 이동 제어(상하좌우 편향)도 지원합니다.

소비자용 GPU에서의 성능 최적화를 위해 CPU 오프로딩 및 float8 양자화와 같은 메모리 관리 전략을 구현했습니다.

대상 사용자

이 도구는 움직임과 스타일에 대해 높은 제어력을 원하는 AI 아티스트, 콘텐츠 크리에이터, 개발자에게 적합합니다. 또한 특정 스타일 변환을 위한 자체 베이스라인 또는 Lora 모델을 훈련하고자 하는 연구자에게도 적합합니다.

주요 특징

  • 다중 모델 지원: CogVideoX-Fun 및 Wan 2.1 시리즈(1.3B 및 14B 모델)의 통합 지원.
  • 정밀한 제어: 카메라 궤적 제어 및 구조적 안내(Canny, 깊이, 포즈) 지원.
  • 사용자 정의 훈련: 베이스라인 및 Lora 모델 훈련 가능. 인간 선호 최적화를 위한 Reward Lora 지원 포함.
  • 유연한 배포: ComfyUI, Docker, 또는 직접 Python 스크립트를 통해 사용 가능하며, Windows 및 Linux 모두 지원.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트