Vchitect/Latte
[TMLR 2025] Latte: Latent Diffusion Transformer for Video Generation.
解決的問題
Latte 設計用於從文字提示或類別標籤生成高品質影片。它解決了在建模影片複雜的時空分佈之同時,管理處理大量影片標記所帶來的高計算成本的挑戰。
工作原理
Latte 是一種潛在擴散 Transformer。它首先從輸入影片中提取時空標記,然後使用一系列 Transformer 模塊在潛在空間中建模影片分佈。為了有效處理大量標記,它引入了四種變體,將輸入影片的空間與時間維度進行分解。該模型還結合了影片片段塊嵌入、時間位置嵌入以及時間步-類別資訊注入等特定最佳實務,以提升輸出品質。
適用對象
本專案適用於從事影片生成、擴散模型,以及將 Transformer 結合至生成式影片 AI 的 AI 研究人員與開發者。
主要亮點
- 多模態生成:支援文字到影片(T2V)與文字到影像(T2I)生成。
- 高效架構:採用具時空分解的潛在擴散 Transformer,有效管理標記數量。
- 最尖端性能:在 FaceForensics、SkyTimelapse、UCF101 與 Taichi-HD 等標準資料集上達成高表現。
- 廣泛整合:已整合至 Hugging Face
diffusers套件,支援 4/8 位量化,降低 GPU 記憶體使用量。
相關
- Dispatch
- Dispatch
- 專案
- 專案
- 專案