Correr-Zhou/OmniShow

[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation

What it solves

OmniShow 是为 Human-Object Interaction Video Generation (HOIVG) 设计的。它解决了在生成高保真视频时让人类与物体交互的难题,同时允许用户通过多种输入(多模态条件)同步控制输出,例如文本、人物和物体的参考图像、音频以及姿势序列。

How it works

OmniShow 使用统一的框架来处理各种生成任务(R2V、RA2V、RP2V、以及 RAP2V),核心包含三个技术要点:

  1. Unified Channel-wise Conditioning:该方法通过将参考图像和姿势提示拼接到视频 token 中,使用伪帧(pseudo‑frames)和重建损失,确保语义细节得以保留。
  2. Gated Local-Context Attention:通过将音频特征与上下文打包,并使用遮蔽注意力和自适应门控,使视频帧与音频片段同步对齐,实现音画同步。
  3. Decoupled-Then-Joint Training:模型分阶段训练:先在不同数据集上分别训练参考到视频(R2V)和音频到视频(A2V)的专属模型,之后以权重插值融合,最后共同微调。

Who it’s for

此项目适合从事可控视频生成、数字化身和多模态 AI 研究与开发的研究者和工程师,特别是对打造真实的人与物体交互感兴趣的人。

Highlights

  • All-in-one Model:首个将文本、参考图像、音频与姿势条件统一于 HOIVG 的模型。
  • Flexible Task Support:支持多种配置,包括 Reference+Audio+Pose‑to‑Video (RAP2V)。
  • Comprehensive Benchmark:推出 HOIVG‑Bench,专门用于评估多模态 HOIVG 的数据集。
  • Versatile Applications:可用于音频驱动的化身、物体置换与视频混音等多元应用。