Correr-Zhou/OmniShow
[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation
What it solves
OmniShow は Human-Object Interaction Video Generation (HOIVG) 用に設計されています。人間が物体と相互作用する高忠実度の動画を生成する課題を解決し、テキスト、人物・物体の参照画像、音声、ポーズシーケンスといった複数の入力(マルチモーダル条件)を同時に用いて出力を制御できるようにします。
How it works
OmniShow は統一フレームワークを用いて、さまざまな生成タスク(R2V、RA2V、RP2V、RAP2V)を処理します。主な技術要素は次の 3 つです。
- Unified Channel-wise Conditioning:参照画像とポーズ情報をビデオトークンに連結し、疑似フレーム(pseudo‑frames)と再構成ロスを用いて意味的ディテールを保持します。
- Gated Local-Context Attention:音声特徴をコンテキストと共にパックし、マスク付きアテンションと適応ゲートでビデオフレームと音声セグメントを同期させ、音声と映像の同期を実現します。
- Decoupled-Then-Joint Training:モデルは段階的に学習されます。まず、参照からビデオへの変換(R2V)と音声からビデオへの変換(A2V)用の専門モデルを別々のデータセットで訓練し、次に重みの補間で融合し、最後に共同でファインチューニングします。
Who it’s for
本プロジェクトは、制御可能な動画生成、デジタルアバター、マルチモーダル AI に取り組む研究者や開発者、特にリアルな人と物体の相互作用を作り出すことに関心のある方を対象としています。
Highlights
- All-in-one Model:テキスト、参照画像、音声、ポーズ条件を統合した初の HOIVG 用モデル。
- Flexible Task Support:Reference+Audio+Pose‑to‑Video (RAP2V) を含む複数の構成をサポート。
- Comprehensive Benchmark:マルチモーダル HOIVG を評価するための専用データセット HOIVG‑Bench を導入。
- Versatile Applications:音声駆動アバター、オブジェクト入れ替え、動画リミックスなど多様な応用が可能。