Junchao-cs/SolarWM
Open data and scalable training for long-horizon video world models.
何を解決するか
SolarWMは、インタラクティブなビデオ・ワールドモデルを作成するための、包括的なオープンソースの基盤を提供します。これは、短いトレーニングクリップ(約5秒)のみを使用しながら、長時間のカメラ制御可能なビデオ・ロールアウト(数分から数時間に及ぶ)を生成できるモデルのトレーニングにおける困難さを解決し、同時に既存の様々なビデオ・モデル・バックボーンとの互換性を維持します。
仕組み
SolarWMは、統一されたデータ・インフラストラクチャを使用して、数百万のビデオ・クリップを、カメラの幾何学情報やキャプションを含む標準化された形式に処理します。その後、双方向ビデオ・モデルを因果的(causal)な自己回帰モデルに変換するために、3段階のトレーニング・レシピを採用しています:
- Stage 0.5 (Bidirectional Adaptation): ビデオ、テキスト、およびカメラの条件付けのためのベースとなる表現を確立します。
- Stage 1 (Teacher-Forced AnyFlow): ティーチャー・フォーシング(teacher forcing)とAnyFlow損失を組み合わせ、デノイジングと有限ステップのフロー・マップを学習することで、個別のODE初期化の必要性を排除します。
- Stage 2 (Distribution Matching Distillation): 自己勾配フォーシング(self-gradient forcing (SGF))を使用して、凍結されたティーチャー・モデルと学習可能なクリティック(critic)を用いて、自身のロールアウト上での因果的スチューデント・モデルのトレーニングを行います。
対象者
Wan2.2、LTX-2.5、MiniMax-H3などの多様なビデオ・バックボーンを基盤として構築できるスケーラブルなフレームワークを求める、ビデオ生成、ワールドモデル、およびインタラクティブなAI環境に取り組む研究者や開発者。
ハイライト
- Backbone Agnostic: さまざまなアーキテクチャにわたる複数の5B–33Bモデル・ファミリーをサポートします。
- Long-Horizon Inference: 長いシーケンスのファインチューニングを必要とせずに、リアルタイムのインタラクションと数分から数時間に及ぶロールアウトを可能にします。
- Open Data Pipeline: 14のデータセットから143万個の標準的なクリップを含む、再構成可能なインフラストラクチャを含んでいます。
- Simplified Training: 複雑なODEや一貫性蒸留(consistency-distillation)の初期化を回避する、合理化された3段階のレシピを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト