AlayaLab/Evoke
Official implementation of EVOKE: Endless Interactive World with Bounded State and Long-Horizon Supervision. A three-step, CFG-free interactive world model. SOTA on WBench.
何を解決するか
EVOKEは、窓付き生成で見られる典型的なメモリと品質の劣化を回避する高品質で長時間の動画を生成するための世界モデルです。『メモリの上限』の問題を、シーンの幾何学情報を格納する外部の世界状態バンクを使用することで解決し、計算やデノイザーのメモリ要件を増加させることなく、ほぼ無限のロールアウトが可能になります。
仕組み
EVOKEは、3段階のCFGフリー(分類器フリー指導)推論プロセスを用いて、動画チャンクを自己回帰的に生成します。発生したチャンクから深度を推定し、それをバンクにアンプロジェクションすることで、『世界状態バンク』に恒常的な点群を維持します。新しいフレームを生成する際、現在のカメラポーズに基づいてこのバンクから読み取り、必要な視覚情報をのみ取得・変形します。このプロセスは、長期間・中期間・短期間の3段階メモリシステムと、効率的な少数ステップ生成を可能にする専用の教師-生徒蒸留パイプラインによってサポートされています。
対象ユーザー
このプロジェクトは、世界モデル、長時間動画生成、カメラ制御可能な合成環境に取り組むAI研究者および開発者向けです。
主な特徴
- 無限の生成: カメラインデックス付きの世界状態バンクを使用し、セッションの長さに関係なくコンテキストを制限します。
- 高効率: 単一の H200 GPU 上で、3ステップ、CFGゼロで2.11秒ごとに1.5秒の動画を生成します。
- 飛行中リプロンプト: ロールアウト中にテキストプロンプトを変更でき、再起動や動画の切断を必要としません。
- カメラ制御: 専用の Director Web UI を通じて、正確なカメラ移動と回転をサポートします。
- 柔軟な条件指定: テキストから動画(t2v)、画像から動画(i2v)、動画から動画(v2v)のモードを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト