NVlabs/LongLive

Long Video Gen Infrastructure

何を解決するか

LongLive 2.0は、長尺ビデオ生成をより効率的かつスケーラブルにするために設計されたインフラストラクチャです。ビデオフレームの長いシーケンスを生成する際に関連する高い計算コストとメモリコストに対処し、リアルタイムのインタラクティブな生成と高スループットな推論を可能にします。

仕組み

このプロジェクトは、NVFP4(4ビット浮動小数点フォーマット)とシーケンス並列化を活用して、トレーニングと推論の両方を最適化する並列インフラストラクチャを実装しています。

トレーニングにおいては、text-to-video (T2V) および image-to-video (I2V) モダリティの自己回帰(AR)教師強制トレーニング、および生成に必要なステップ数を削減するための数ステップ蒸留(DMD distillation)をサポートしています。

推論においては、メモリオーバーヘッドを削減するためのNVFP4重みとKV cache、シーケンス並列推論、および非同期デコーディングを利用しています。また、長時間の安定性を維持するために、multi-shot attention sinksのような技術も組み込んでいます。

対象者

このインフラストラクチャは、長期間のビデオ生成に取り組む研究者や開発者、特にNVIDIA GPU (SM90/H100) を使用してスループットを最大化し、ハードウェア加速された量子化を利用しようとする方を対象としています。

ハイライト

  • NVFP4 Support: W4A4量子化とNVFP4 KV cacheを実装し、大幅に高速な推論(最大45.7 FPS)を実現します。
  • Causal Diffusion: 効率的な数ステップのビデオ生成のために、ARトレーニングとDMD distillationの両方をサポートします。
  • Parallelism: 長いシーケンスを扱うために、バランスの取れたシーケンス並列トレーニングとシーケンス並列推論を備えています。
  • Versatile Modalities: text-to-video (T2V) および image-to-video (I2V) ワークフローの両方をサポートします。
  • FP8 PTQ: BF16チェックポイント用のTorchAO FP8 事後トレーニング量子化(post-training quantization)を含みます。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト