caiyuanhao1998/Open-OmniVCus
OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions (NeurIPS 2025)
解决的问题
OmniVCus 解决了主题驱动的视频定制挑战,允许用户生成包含特定主题(由参考图像定义)的视频,同时通过深度图、掩码、运动(光流)和相机位姿等多种多模态控制条件,精确控制视频内容。
工作原理
该项目采用扩散Transformer(DiT)架构和专用的数据构建流水线。通过将深度图、掩码、运动(光流)和相机位姿等多模态控制条件整合到生成过程中,实现前馈式主题定制。实现中利用了 Lottery Embedding(LE)和 Temporally Aligned Embedding(TAE)来有效处理这些控制信号。其基础模型包括 Wan2.1 和 Wan2.2。
适用人群
本工具专为希望在严格结构或运动约束下生成具有稳定主题的AI视频的研究人员和开发者设计。
核心亮点
- 多模态控制:支持深度、掩码和运动等多种控制条件。
- 主题驱动:使用参考图像确保生成视频中主题的一致性。
- 完整流水线:包含数据构建工厂(
VideoCus-Factory),可从原始视频创建所需的多模态配对数据。 - 灵活模型规模:提供基于不同模型规模的实现,包括 1.3B 和 14B 参数版本。
相关
- 项目
- 项目
- 项目
- 项目