Correr-Zhou/OmniShow
[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation
What it solves
OmniShow 是為了 Human-Object Interaction Video Generation (HOIVG) 所設計。它解決了在產生高保真度影片時,讓人類與物件互動的問題,同時允許使用者透過多種輸入(多模態條件)同步控制輸出,例如文字、人物與物件的參考圖像、音訊以及姿勢序列。
How it works
OmniShow 使用統一的框架來處理各種生成任務(R2V、RA2V、RP2V、以及 RAP2V),核心包含三個技術要點:
- Unified Channel-wise Conditioning:此方法透過將參考圖像與姿勢提示串接到影片 token 中,使用偽影格(pseudo‑frames)與重建損失,確保語意細節得以保留。
- Gated Local-Context Attention:透過將音訊特徵與上下文打包,並使用遮蔽注意力與自適應門控,使影片畫格與音訊片段同步對齊,達成音視同步。
- Decoupled-Then-Joint Training:模型分階段訓練:先在不同資料集上分別訓練參考到影片(R2V)與音訊到影片(A2V)的專屬模型,之後以權重插值融合,最後共同微調。
Who it’s for
此專案適合從事可控影片生成、數位化身與多模態 AI 研究與開發的研究者與工程師,特別是對於打造寫實的人與物件互動有興趣的人。
Highlights
- All-in-one Model:首個將文字、參考圖像、音訊與姿勢條件統合於 HOIVG 的模型。
- Flexible Task Support:支援多種配置,包括 Reference+Audio+Pose‑to‑Video (RAP2V)。
- Comprehensive Benchmark:推出 HOIVG‑Bench,專門用於評估多模態 HOIVG 的資料集。
- Versatile Applications:可用於音訊驅動的化身、物件置換與影片混音等多元應用。