alibaba/Tora
[CVPR'25]Tora: Trajectory-oriented Diffusion Transformer for Video Generation
何を解決するか
Toraは、高品質な動画を生成する際の動きの制御を可能にする。標準的なDiffusion Transformer(DiT)は視覚的に印象的なコンテンツを生成できるが、シーン内のオブジェクトの動きを正確に制御することができないことが多い。Toraは特定の軌道を使用して動画生成をガイドすることで、コンテンツの動きが定義された経路に従うことを保証する。
動作方法
Toraは、テキスト、視覚、軌道条件を組み合わせる軌道指向型Diffusion Transformerフレームワークである。主に以下の3つのコンポーネントで構成される:
- 軌道抽出器(TE): 3D動画圧縮ネットワークを使用して、任意の運動軌道を階層的な時空間運動パッチにエンコードする。
- 空間時系列DiT: 動画フレームを生成するコアTransformerアーキテクチャ。
- 運動ガイド融合器(MGF): 運動パッチをDiTブロックに統合し、生成された動画が提供された軌道を一貫して追うようにする。
対象ユーザー
このプロジェクトは、特に合成動画におけるオブジェクトのダイナミクスや物理的移動を正確に制御したいAI研究者や開発者向けに設計されている。
特徴
- 多条件ガイド付き生成: テキスト、画像、軌道パスを同時に統合して生成を実現。
- T2VおよびI2V対応: Text-to-VideoおよびImage-to-Videoのワークフローをサポート。
- スケーラブル設計: DiTのスケーラビリティに準拠し、さまざまな解像度、アスペクト比、再生時間に対応可能。
- 高精度な運動忠実性: 物理世界の動きを高精度でシミュレートすることを目的として設計。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- Dispatch