Correr-Zhou/OmniShow

[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation

何を解決するか

OmniShowは、テキスト、画像、音声、ポーズなどの複数の制御信号を使用して、人間と物体の相互作用を再現する高精細な動画を生成するという課題に取り組んでいます(人間-物体相互作用動画生成、HOIVG)。従来のモデルは、テキスト、画像、音声、ポーズといった異なるモダリティを統合する際に、視覚的一貫性や同期性を維持するのが難しかったです。

動作方法

OmniShowは、Wanモデルに基づく統合フレームワークを使用して、さまざまな入力を処理します:

  • 統合チャネルごとの条件付け:参照画像とポーズの手がかりをチャネルとして連結し、擬似フレームと再構成損失を用いて意味的な詳細を保持します。
  • ゲート付き局所的コンテキストアテンション:マスク付きアテンションと適応的ゲートを用いて音声特徴と動画フレームを同期させ、音声と視覚要素の整合性を確保します。
  • 分離してから統合する訓練:まず、参照画像→動画(R2V)、音声→動画(A2V)などの専門的なサブタスクで訓練し、重みの補間と共同微調整によりすべての機能を一つのモデルに統合します。

対象ユーザー

本プロジェクトは、マルチモーダル動画生成に取り組む研究者や開発者、特に人間中心のコンテンツ、音声駆動アバター、制御可能な動画合成に注力する人々向けです。

主な特徴

  • ワンストップモデル:テキスト、参照画像、音声、ポーズの条件付けを同時にサポートします。
  • 柔軟なタスクカバレッジ:R2V(参照)、RA2V(参照+音声)、RP2V(参照+ポーズ)、RAP2V(参照+音声+ポーズ)など、さまざまな生成モードに対応します。
  • 包括的なベンチマーク:マルチモーダルHOIVG専用のデータセットと評価スイートであるHOIVG-Benchを導入しました。
  • 多様な応用:オブジェクトの交換、動画のリミックス、音声駆動アバターの作成が可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト