Vchitect/Latte
[TMLR 2025] Latte: Latent Diffusion Transformer for Video Generation.
해결하는 문제
Latte는 텍스트 프롬프트 또는 클래스 레이블에서 고품질의 비디오를 생성하도록 설계되었습니다. 방대한 비디오 토큰을 처리할 때 발생하는 높은 계산 비용을 관리하면서도, 비디오의 복잡한 공간-시간 분포를 모델링하는 도전 과제를 해결합니다.
작동 방식
Latte는 잠재 확산 트랜스포머(Latent Diffusion Transformer)입니다. 입력 비디오에서 공간-시간 토큰을 추출한 후, 잠재 공간 내에서 비디오 분포를 모델링하기 위해 일련의 트랜스포머 블록을 사용합니다. 대량의 토큰을 효율적으로 처리하기 위해 입력 비디오의 공간적 및 시간적 차원을 분해하는 네 가지 변형을 도입합니다. 또한 비디오 클립 패치 임베딩, 시간적 위치 임베딩, 타임스텝-클래스 정보 주입에 대한 특별한 최적 실천 방안을 포함하여 출력 품질을 향상시킵니다.
대상 사용자
이 프로젝트는 비디오 생성, 확산 모델, 트랜스포머를 생성형 비디오 AI에 통합하는 데 종사하는 AI 연구자 및 개발자에게 적합합니다.
주요 특징
- 다중 모달 생성: 텍스트에서 비디오(T2V) 및 텍스트에서 이미지(T2I) 생성을 모두 지원합니다.
- 효율적인 아키텍처: 공간-시간 분해를 사용한 잠재 확산 트랜스포머로 토큰 수를 관리합니다.
- 최첨단 성능: FaceForensics, SkyTimelapse, UCF101, Taichi-HD와 같은 표준 데이터셋에서 높은 성능을 달성합니다.
- 광범위한 통합: Hugging Face
diffusers라이브러리에 통합되어 4/8비트 양자화를 지원하여 GPU 메모리 사용량을 줄입니다.
관련
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트