Vchitect/Latte

[TMLR 2025] Latte: Latent Diffusion Transformer for Video Generation.

何を解決するか

Latteは、テキストプロンプトまたはクラスラベルから高品質な動画を生成するように設計されています。動画の複雑な空間時系列分布をモデル化する課題に取り組みつつ、多数の動画トークンを処理する際の高い計算コストを管理します。

動作方法

Latteは、潜在空間における動画分布をモデル化するための潜在拡散Transformerです。入力動画から空間時系列トークンを抽出し、一連のTransformerブロックを使用してその分布を学習します。大量のトークンを効率的に処理するために、入力動画の空間的・時系列的次元を分解する4つのバリエーションを導入しています。また、動画クリップのパッチ埋め込み、時系列位置埋め込み、タイムステップ・クラス情報の注入といった特定のベストプラクティスを組み込むことで、出力品質を向上させます。

対象ユーザー

このプロジェクトは、動画生成、拡散モデル、Transformerを生成型AIに統合する研究開発に従事するAI研究者や開発者向けです。

主な特徴

  • マルチモーダル生成: テキストから動画(T2V)およびテキストから画像(T2I)の生成をサポート。
  • 効率的なアーキテクチャ: 空間時系列分解を用いた潜在拡散Transformerにより、トークン数を管理。
  • 最先端のパフォーマンス: FaceForensics、SkyTimelapse、UCF101、Taichi-HDなどの標準データセットで高い性能を達成。
  • 広範な統合: Hugging Face diffusersライブラリに統合され、4/8ビット量子化をサポートし、GPUメモリ使用量を削減。

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト