caiyuanhao1998/Open-OmniVCus

OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions (NeurIPS 2025)

何を解決するか

OmniVCusは、特定の被写体(参照画像で定義)を含む動画を生成しながら、深度マップ、マスク、動き(オプティカルフロー)、カメラポーズなどのマルチモーダル制御条件を通じて動画の内容を正確に制御できる、被写体中心の動画カスタマイズの課題に対処します。

動作方法

このプロジェクトは、拡散Transformer(DiT)アーキテクチャと専用のデータ構築パイプラインを使用しています。深度マップ、マスク、動き(オプティカルフロー)、カメラポーズなどのマルチモーダル制御条件を生成プロセスに統合することで、フィードフォワード型の被写体カスタマイズを実現します。Lottery Embedding(LE)とTemporally Aligned Embedding(TAE)を活用して、これらの制御信号を効果的に処理します。ベースモデルとしてWan2.1やWan2.2を利用しています。

対象ユーザー

AI動画生成分野の研究者や開発者向けです。厳密な構造的または運動的制約下で一貫した被写体を持つ動画を作成したい方におすすめです。

特徴

  • マルチモーダル制御: 深度、マスク、動きなど、さまざまな制御条件をサポート。
  • 被写体中心: 参照画像を使用して、生成された動画全体で被写体の一貫性を確保。
  • 包括的なパイプライン: リアルな動画からマルチモーダルペアを構築するためのデータ構築ファクトリ(VideoCus-Factory)を含む。
  • 柔軟なモデルサイズ: 1.3Bおよび14Bパラメータバージョンなど、異なるモデルスケールに基づく実装を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト