Correr-Zhou/OmniShow
[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation
解決的問題
OmniShow 是為了解決使用多種控制訊號生成人類與物件互動的高保真影片(人類-物件互動影片生成,HOIVG)的挑戰而設計。以往的模型在將文字、影像、音訊與姿態等不同模態統一至單一框架時,往往難以維持視覺一致性與同步性。
如何運作
OmniShow 使用基於 Wan 模型的統一框架來處理各種輸入:
- 統一通道式條件化:透過將參考影像與姿態提示作為通道串接注入,並使用偽幀與重建損失來保持語意細節完整。
- 門控局部上下文注意力:此機制利用遮罩注意力與自適應門控,將音訊特徵與影片幀對齊,確保音訊與視覺元素同步。
- 分離後再整合訓練:模型先在專門的子任務(如參考影像到影片、音訊到影片)上訓練,再透過權重插值與聯合微調融合,將所有能力整合為單一模型。
適用對象
本專案適用於從事多模態影片生成的研究人員與開發者,特別是專注於以人類為中心的內容、音訊驅動的虛擬角色,以及可控制影片合成的領域。
主要亮點
- 一體化模型:同時支援文字、參考影像、音訊與姿態條件輸入。
- 彈性任務覆蓋:支援多種生成模式,包括 R2V(參考)、RA2V(參考 + 音訊)、RP2V(參考 + 姿態)與 RAP2V(參考 + 音訊 + 姿態)。
- 全面的基準測試:引入 HOIVG-Bench,一個專為多模態 HOIVG 設計的資料集與評估套件。
- 多功能應用:支援物件替換、影片重混與建立音訊驅動的虛擬角色。
相關
- 專案
- 專案
- 專案
- 專案
- 專案