alibaba/Tora
[CVPR'25]Tora: Trajectory-oriented Diffusion Transformer for Video Generation
解决的问题
Tora 解决了生成高质量、可控制运动的视频的挑战。虽然标准的扩散变换器(DiT)可以生成视觉上令人印象深刻的视频内容,但通常难以精确控制场景中物体的运动方式。Tora 允许用户通过特定轨迹引导视频生成,确保内容的运动遵循定义好的路径。
工作原理
Tora 是一种面向轨迹的扩散变换器框架,结合了文本、视觉和轨迹条件。它包含三个主要组件:
- 轨迹提取器(TE): 使用 3D 视频压缩网络,将任意运动轨迹编码为分层的时空运动块。
- 时空 DiT: 生成视频帧的核心变换器架构。
- 运动引导融合器(MGF): 将运动块整合到 DiT 块中,确保生成的视频始终遵循提供的轨迹。
适用人群
本项目专为从事视频生成的 AI 研究人员和开发者设计,特别是那些需要在合成视频中精确控制物体动态和物理运动的用户。
主要亮点
- 多条件引导: 同时整合文本、图像和轨迹路径进行生成。
- 支持 T2V 和 I2V: 支持文本到视频(T2V)和图像到视频(I2V)工作流。
- 可扩展设计: 与 DiT 的可扩展性保持一致,支持多种分辨率、宽高比和时长。
- 高运动保真度: 专门设计用于以高精度模拟物理世界中的运动。
相关
- 项目
- Dispatch
- 项目
- 项目
- Dispatch