OpenMOSS/MOVA
MOVA: Towards Scalable and Synchronized Video–Audio Generation
What it solves
MOVA 是一個基礎模型,旨在同時產生高保真影片與同步音訊。它消除需要級聯管線的情況,音訊不再是獨立且常常不同步的步驟,解決了開源影片生成中常見的唇形不同步與音效不同步問題。
How it works
MOVA 採用非對稱雙塔架構,結合預訓練的影片塔與音訊塔。這兩個塔透過雙向交叉注意力機制融合,使模型能在單次推論中合成兩種模態。它支援 Text-to-Video-Audio (T2VA) 與 Image-to-Video-Audio (I2VA) 工作流程。
Who it’s for
此專案適用於需要高品質、同步視聽內容的 AI 研究者、開發者與內容創作者。特別適合想實作多語言唇形同步或環境感知音效的使用者。
Highlights
- Native Bimodal Generation: 以一次推論同時產生影片與音訊,避免誤差累積,確保完美對齊。
- Precise Lip-Sync: 在多語言唇形同步上達到最先進的表現。
- Open-Source Ecosystem: 提供模型權重、推論程式碼、訓練管線與 LoRA 微調腳本。
- Broad Integration: 支援 SGLang 以實現高吞吐量推論,透過社群插件整合至 ComfyUI,並提供託管 API。
- Flexible Hardware Support: 包含 VRAM 卸載的最佳化,並支援 Ascend NPU。