Correr-Zhou/OmniShow
[ICML 2026] ByteDance's All-in-One Video Generation Model for Human-Object Interaction Video Generation
What it solves
OmniShow 是为 Human-Object Interaction Video Generation (HOIVG) 设计的。它解决了在生成高保真视频时让人类与物体交互的难题,同时允许用户通过多种输入(多模态条件)同步控制输出,例如文本、人物和物体的参考图像、音频以及姿势序列。
How it works
OmniShow 使用统一的框架来处理各种生成任务(R2V、RA2V、RP2V、以及 RAP2V),核心包含三个技术要点:
- Unified Channel-wise Conditioning:该方法通过将参考图像和姿势提示拼接到视频 token 中,使用伪帧(pseudo‑frames)和重建损失,确保语义细节得以保留。
- Gated Local-Context Attention:通过将音频特征与上下文打包,并使用遮蔽注意力和自适应门控,使视频帧与音频片段同步对齐,实现音画同步。
- Decoupled-Then-Joint Training:模型分阶段训练:先在不同数据集上分别训练参考到视频(R2V)和音频到视频(A2V)的专属模型,之后以权重插值融合,最后共同微调。
Who it’s for
此项目适合从事可控视频生成、数字化身和多模态 AI 研究与开发的研究者和工程师,特别是对打造真实的人与物体交互感兴趣的人。
Highlights
- All-in-one Model:首个将文本、参考图像、音频与姿势条件统一于 HOIVG 的模型。
- Flexible Task Support:支持多种配置,包括 Reference+Audio+Pose‑to‑Video (RAP2V)。
- Comprehensive Benchmark:推出 HOIVG‑Bench,专门用于评估多模态 HOIVG 的数据集。
- Versatile Applications:可用于音频驱动的化身、物体置换与视频混音等多元应用。