SandAI-org/MAGI-2-preview

MAGI-2-preview: Scaling Video Generation Models Efficiently

해결하는 문제

MAGI-2 Preview는 비디오 생성을 효율적으로 확장하도록 설계되었습니다. 텍스트 또는 이미지 프롬프트로부터 동기화된 오디오가 포함된 고해상도(1080p) 비디오를 생성하는 과제를 해결하는 동시에, 토큰당 파라미터의 극히 일부만 활성화하는 Mixture-of-Experts (MoE) 아키텍처를 사용하여 거대 모델(114B 파라미터) 실행에 따른 계산 비용을 최적화합니다.

작동 방식

이 모델은 2단계 생성 프로세스를 사용합니다. magi2_preview 단계에서 저해상도로 클립의 노이즈를 제거하고, magi2_refiner 단계에서 결과를 1080p로 업스케일링합니다. 텍스트-비디오(T2V) 및 이미지-비디오(I2V) 워크플로우를 모두 지원합니다. 출력 품질을 향상시키기 위해 LLM이 짧은 사용자 프롬프트를 구조화된 상세 캡션으로 다시 작성하는 선택적 프롬프트 강화 단계가 포함되어 있습니다.

대상

이 프로젝트는 통합된 오디오가 포함된 고품질의 10초 비디오 클립을 생성하고자 하는 하이엔드 하드웨어(특히 8개의 NVIDIA Hopper GPU)를 보유한 연구자 및 개발자를 위한 것입니다.

주요 특징

  • 통합 오디오-비디오 생성: 비디오와 사운드를 동시에 생성하여 단일 출력 파일로 믹싱합니다.
  • 효율적인 확장성: 토큰당 6B 파라미터만 활성화하는 114B 파라미터 모델을 활용합니다.
  • 고해상도: 2단계 프리뷰 및 리파인 파이프라인을 통해 1080p 비디오를 생성할 수 있습니다.
  • 유연한 입력: 텍스트-비디오 및 이미지-비디오 생성을 모두 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트