Correr-Zhou/OmniShow
[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation
解决的问题
OmniShow 旨在解决使用多种控制信号生成人类与物体交互的高保真视频(人类-物体交互视频生成,HOIVG)的挑战。以往的模型在将文本、图像、音频和姿态等不同模态统一到一个框架中时,往往难以保持视觉一致性和同步性。
工作原理
OmniShow 基于 Wan 模型构建统一框架,处理多种输入:
- 统一通道条件化:通过将参考图像和姿态线索作为通道拼接注入,并使用伪帧和重建损失来保持语义细节完整。
- 门控局部上下文注意力:该机制通过掩码注意力和自适应门控,将音频特征与视频帧对齐,确保音频与视觉元素同步。
- 解耦后联合训练:模型先在特定子任务(如参考图像到视频、音频到视频)上训练,再通过权重插值和联合微调融合,将所有能力整合为一个模型。
适用人群
本项目适用于从事多模态视频生成的研究人员和开发者,特别是专注于以人为中心的内容、音频驱动的虚拟形象以及可控视频合成的群体。
主要亮点
- 一体化模型:同时支持文本、参考图像、音频和姿态条件输入。
- 灵活的任务覆盖:支持多种生成模式,包括 R2V(参考)、RA2V(参考 + 音频)、RP2V(参考 + 姿态)和 RAP2V(参考 + 音频 + 姿态)。
- 全面的基准测试:引入 HOIVG-Bench,一个专为多模态 HOIVG 设计的数据集和评估套件。
- 多功能应用:支持物体替换、视频重混和创建音频驱动的虚拟形象。
相关
- 项目
- 项目
- 项目
- 项目
- 项目