shengshu-ai/minWM

A Minimal and Elegant Framework & Tutorial for Real-Time Interactive World Models

何を解決するか

minWM は、アクション条件付きのリアルタイム動画ワールドモデルを構築するための完全なオープンソースパイプラインを提供します。標準的な双方向テキストから動画(T2V)基盤モデルを、特定のアクションやカメラ軌道に応答できるリアルタイムでインタラクティブなワールドモデルに変換する複雑なプロセスを簡素化します。

動作方法

このフレームワークは、効率的で少数ステップの自己回帰(AR)学生モデルに基盤モデルを変換するマルチステージ蒸留プロセスを実装しています。パイプラインは2つの主要フェーズで構成されています:

  1. フェーズ1:双方向SFT - 初期の教師あり微調整。
  2. フェーズ2:蒸留 - 教師強制AR拡散、因果ODE/CD(因果強制/因果強制++)、非対称DMDと自己ロールアウトを含む3段階プロセスにより、4ステップのリアルタイム推論を実現します。

複数のバックボーンをサポートしており、特に Wan 2.1HunyuanVideo 1.5 を対象としています。また、ProPEなどの手法を用いてカメラポーズなどの条件を注入可能です。

対象ユーザー

既存のリポジトリをゼロから逆設計しなくても、動画ワールドモデルを構築したい大学院生、独立研究者、およびジュニアラボ向けに設計されています。

特徴

  • フルスタックパイプライン:データ構築・処理からトレーニング、推論までをカバー。
  • マルチバックボーン対応:Wan 2.1 と HunyuanVideo 1.5 の両方のアーキテクチャに対応。
  • リアルタイム推論:4ステップDMD推論プロセスに蒸留することで高速生成を実現。
  • LLMアシストオンボーディング:「Claudeスキル」を搭載し、トレーニング失敗のデバッグや新しいモデルバックボーンの統合を支援。
  • カメラ制御:ポーズ文字列またはJSONファイルを用いて、正確なカメラ軌道制御をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト