Vchitect/Latte

[TMLR 2025] Latte: Latent Diffusion Transformer for Video Generation.

解决的问题

Latte 旨在从文本提示或类别标签生成高质量视频。它解决了在建模视频复杂时空分布的同时,管理处理大量视频标记所带来的高计算成本的挑战。

工作原理

Latte 是一种潜在扩散 Transformer。它首先从输入视频中提取时空标记,然后使用一系列 Transformer 块在潜在空间中建模视频分布。为了高效处理大量标记,它引入了四种变体,将输入视频的空间和时间维度进行分解。该模型还结合了视频片段块嵌入、时间位置嵌入以及时间步-类别信息注入等特定最佳实践,以提升输出质量。

适用人群

本项目适用于从事视频生成、扩散模型以及将 Transformer 集成到生成式视频 AI 中的 AI 研究人员和开发者。

主要亮点

  • 多模态生成:支持文本到视频(T2V)和文本到图像(T2I)生成。
  • 高效架构:采用具有时空分解的潜在扩散 Transformer,有效管理标记数量。
  • 最先进性能:在 FaceForensics、SkyTimelapse、UCF101 和 Taichi-HD 等标准数据集上实现高性能。
  • 广泛集成:已集成至 Hugging Face diffusers 库,支持 4/8 位量化,降低 GPU 内存使用量。

相关

  • Dispatch
  • Dispatch
  • 项目
  • 项目
  • 项目