Correr-Zhou/OmniShow

[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation

解决的问题

OmniShow 旨在解决使用多种控制信号生成人类与物体交互的高保真视频(人类-物体交互视频生成,HOIVG)的挑战。以往的模型在将文本、图像、音频和姿态等不同模态统一到一个框架中时,往往难以保持视觉一致性和同步性。

工作原理

OmniShow 基于 Wan 模型构建统一框架,处理多种输入:

  • 统一通道条件化:通过将参考图像和姿态线索作为通道拼接注入,并使用伪帧和重建损失来保持语义细节完整。
  • 门控局部上下文注意力:该机制通过掩码注意力和自适应门控,将音频特征与视频帧对齐,确保音频与视觉元素同步。
  • 解耦后联合训练:模型先在特定子任务(如参考图像到视频、音频到视频)上训练,再通过权重插值和联合微调融合,将所有能力整合为一个模型。

适用人群

本项目适用于从事多模态视频生成的研究人员和开发者,特别是专注于以人为中心的内容、音频驱动的虚拟形象以及可控视频合成的群体。

主要亮点

  • 一体化模型:同时支持文本、参考图像、音频和姿态条件输入。
  • 灵活的任务覆盖:支持多种生成模式,包括 R2V(参考)、RA2V(参考 + 音频)、RP2V(参考 + 姿态)和 RAP2V(参考 + 音频 + 姿态)。
  • 全面的基准测试:引入 HOIVG-Bench,一个专为多模态 HOIVG 设计的数据集和评估套件。
  • 多功能应用:支持物体替换、视频重混和创建音频驱动的虚拟形象。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目