vita-epfl/Stable-Video-Infinity
[ICLR 26 Oral] Stable Video Infinity: Infinite-Length Video Generation with Error Recycling
解決する課題
Stable Video Infinity (SVI) は、AI モデルにおける短尺ビデオ生成の制限に対処し、高い時間的一貫性、自然なシーン遷移、および制御可能なストーリーラインを維持しながら、品質の低下や時間の経過に伴う「忘却」なしに、任意の長さ(理論上は無限)のビデオを作成することを可能にします。
仕組み
SVI はハイブリッド因果アプローチを採用しています。個々のビデオクリップ内で双方向アテンションを使用して高い視覚品質を確保し、その後、クリップ間の因果関係を使用してこれらのクリップを順次接続します。このシステムは Wan 2.1 や Wan 2.2 などのベースモデル上で調整された LoRA アダプターとして実装されており、最小限のトレーニングデータで長尺生成能力を実現します。
対象ユーザー
短編映画、単一シーンのアニメーション、ストーリーテリングビデオなど、数分間にわたる一貫性が不可欠な長尺の AI ビデオコンテンツを制作する必要があるクリエイター、映画製作者、アニメーター向けに設計されています。
ハイライト
- 無限の長さ: 持続時間に本質的な制限はなく、10 分以上のビデオを生成可能です。
- 高い一貫性: 視覚的な安定性を維持し、長いシーケンス全体での色のズレやコンテンツの劣化を防ぎます。
- 多用途な生成: マルチシーン映画、単一シーンアニメーション、および条件付き生成(スケルトンやオーディオ)をサポートします。
- 効率的なトレーニング: LoRA アダプターを使用しているため、ユーザーは非常に少ないデータで独自の SVI バリアントを簡単に作成できます。
- オープンソース: オープンなトレーニングスクリプト、評価ツール、データセットを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト