Correr-Zhou/OmniShow

[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation

解決的問題

OmniShow 是為了解決使用多種控制訊號生成人類與物件互動的高保真影片(人類-物件互動影片生成,HOIVG)的挑戰而設計。以往的模型在將文字、影像、音訊與姿態等不同模態統一至單一框架時,往往難以維持視覺一致性與同步性。

如何運作

OmniShow 使用基於 Wan 模型的統一框架來處理各種輸入:

  • 統一通道式條件化:透過將參考影像與姿態提示作為通道串接注入,並使用偽幀與重建損失來保持語意細節完整。
  • 門控局部上下文注意力:此機制利用遮罩注意力與自適應門控,將音訊特徵與影片幀對齊,確保音訊與視覺元素同步。
  • 分離後再整合訓練:模型先在專門的子任務(如參考影像到影片、音訊到影片)上訓練,再透過權重插值與聯合微調融合,將所有能力整合為單一模型。

適用對象

本專案適用於從事多模態影片生成的研究人員與開發者,特別是專注於以人類為中心的內容、音訊驅動的虛擬角色,以及可控制影片合成的領域。

主要亮點

  • 一體化模型:同時支援文字、參考影像、音訊與姿態條件輸入。
  • 彈性任務覆蓋:支援多種生成模式,包括 R2V(參考)、RA2V(參考 + 音訊)、RP2V(參考 + 姿態)與 RAP2V(參考 + 音訊 + 姿態)。
  • 全面的基準測試:引入 HOIVG-Bench,一個專為多模態 HOIVG 設計的資料集與評估套件。
  • 多功能應用:支援物件替換、影片重混與建立音訊驅動的虛擬角色。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案