OpenMOSS/MOVA
MOVA: Towards Scalable and Synchronized Video–Audio Generation
What it solves
MOVA 是一个基础模型,旨在同时生成高保真视频和同步音频。它消除了需要级联管线的情况,音频不再是独立且常常不同步的步骤,解决了开源视频生成中常见的唇形不同步和音效不同步问题。
How it works
MOVA 使用非对称双塔架构,结合预训练的视频塔和音频塔。这些塔通过双向交叉注意力机制融合,使模型能够在单次推理中合成两种模态。它支持 Text-to-Video-Audio (T2VA) 与 Image-to-Video-Audio (I2VA) 工作流。
Who it’s for
该项目面向需要高质量、同步视听内容的 AI 研究者、开发者和内容创作者。特别适用于想实现多语言唇形同步或环境感知音效的用户。
Highlights
- Native Bimodal Generation: 一次推理同时生成视频和音频,防止误差累积,确保完美对齐。
- Precise Lip-Sync: 在多语言唇形同步上实现业界领先的性能。
- Open-Source Ecosystem: 提供模型权重、推理代码、训练管线和 LoRA 微调脚本。
- Broad Integration: 支持 SGLang 进行高吞吐量推理,通过社区插件集成至 ComfyUI,并提供托管 API。
- Flexible Hardware Support: 包含 VRAM 卸载优化,并支持 Ascend NPU。