alibaba/Tora

[CVPR'25]Tora: Trajectory-oriented Diffusion Transformer for Video Generation

해결하는 문제

Tora는 제어 가능한 움직임을 가진 고품질 동영상을 생성하는 문제를 해결합니다. 표준 Diffusion Transformer(DiT)는 시각적으로 인상적인 콘텐츠를 생성할 수 있지만, 장면 내 객체의 움직임을 정밀하게 제어하는 데 어려움이 있습니다. Tora는 특정 궤적을 사용하여 동영상 생성을 안내함으로써 콘텐츠의 움직임이 정의된 경로를 따르도록 보장합니다.

작동 방식

Tora는 텍스트, 시각, 궤적 조건을 결합하는 궤적 중심 Diffusion Transformer 프레임워크입니다. 주요 구성 요소는 다음과 같습니다:

  1. 궤적 추출기(TE): 3D 비디오 압축 네트워크를 사용하여 임의의 운동 궤적을 계층적인 시공간 운동 패치로 인코딩합니다.
  2. 공간-시간 DiT: 동영상 프레임을 생성하는 핵심 트랜스포머 아키텍처입니다.
  3. 운동 가이드 퓨저(MGF): 운동 패치를 DiT 블록에 통합하여 생성된 동영상이 제공된 궤적을 일관되게 따르도록 합니다.

대상 사용자

이 프로젝트는 합성 동영상에서 객체의 역학 및 물리적 움직임을 정밀하게 제어해야 하는 AI 연구자 및 개발자들을 위한 것입니다.

주요 특징

  • 다중 조건 가이드: 텍스트, 이미지, 궤적 경로를 동시에 통합하여 생성을 지원합니다.
  • T2V 및 I2V 지원: 텍스트에서 동영상(T2V), 이미지에서 동영상(I2V) 생성 워크플로우를 모두 지원합니다.
  • 확장 가능한 설계: DiT의 확장성에 부합하여 다양한 해상도, 종횡비, 길이를 지원합니다.
  • 고정밀 운동 충실도: 물리 세계의 움직임을 높은 정밀도로 시뮬레이션하도록 특별히 설계되었습니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch