alibaba/Tora

[CVPR'25]Tora: Trajectory-oriented Diffusion Transformer for Video Generation

解決的問題

Tora 解決了生成高品質、可控制運動的影片的挑戰。雖然標準的擴散變換器(DiT)可以產生視覺上令人印象深刻的內容,但通常難以精確控制場景中物件的運動方式。Tora 允許使用者透過特定軌跡引導影片生成,確保內容的運動遵循定義好的路徑。

工作原理

Tora 是一種面向軌跡的擴散變換器框架,結合了文字、視覺與軌跡條件。它包含三個主要組件:

  1. 軌跡提取器(TE): 使用 3D 影片壓縮網路,將任意運動軌跡編碼為分層的時空運動塊。
  2. 時空 DiT: 生成影片幀的核心變換器架構。
  3. 運動引導融合器(MGF): 將運動塊整合至 DiT 塊中,確保生成的影片始終遵循提供的軌跡。

適用對象

本專案專為從事影片生成的 AI 研究人員與開發者設計,特別是那些需要在合成影片中精確控制物件動態與物理運動的使用者。

主要亮點

  • 多條件引導: 同時整合文字、影像與軌跡路徑進行生成。
  • 支援 T2V 與 I2V: 支援文字轉影片(T2V)與影像轉影片(I2V)工作流程。
  • 可擴展設計: 與 DiT 的可擴展性一致,支援多種解析度、長寬比與時長。
  • 高運動保真度: 專門設計用於以高精度模擬物理世界中的運動。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • Dispatch