OpenMOSS/MOVA

A foundation model that generates synchronized video and audio in a single model

什么是 MOVA?

MOVA(MOSS 视频音频)是一个开源基础模型,能够在单次前向传播中生成同步的视频和音频。它可接收一个文本提示(可选地附带参考图像),并输出一段短视频,其中说出的词语与口型动作同步,背景音效也符合场景。


核心理念

特性 为何重要
原生双模态生成 无需独立的文本→视频 + 文本→音频流水线——模型同时生成两种模态,避免误差累积。
非对称双塔架构 使用预训练的视频编码器和音频编码器,通过双向交叉注意力相互通信,实现丰富的跨模态交互。
唇形同步与音效 在 Verse-Bench 基准测试中表现出最先进的多语言唇形同步和环境感知音频生成能力。
完全开源 模型权重、推理代码、训练流水线、LoRA 微调脚本、评估套件和公共 API 均已发布。
硬件灵活性 支持 GPU、NVIDIA H100/RTX 4090、Ascend NPU,以及在有限 VRAM 环境下的卸载策略。

快速入门(快速启动)

  1. 创建环境
    conda create -n mova python=3.13 -y
    conda activate mova
    pip install -e .
    
  2. 下载检查点(例如 360p)来自 Hugging Face:
    hf download OpenMOSS-Team/MOVA-360p --local-dir /path/to/MOVA-360p
    
  3. 运行推理 – 单人示例:
    export CP_SIZE=1
    export CKPT_PATH=/path/to/MOVA-360p
    torchrun --nproc_per_node=$CP_SIZE \
        scripts/inference_single.py \
        --ckpt_path $CKPT_PATH \
        --cp_size $CP_SIZE \
        --height 352 --width 640 \
        --prompt "A man in a blue blazer …" \
        --ref_path ./assets/single_person.jpg \
        --output_path ./data/samples/single_person.mp4 \
        --seed 42 \
        --offload cpu
    
    多人场景请替换提示和 --ref_path

如何微调(LoRA)

  • 选择 configs/training/ 下的配置文件(低资源、accelerate,或 8-GPU 的 accelerate + FSDP)。
  • 安装训练附加包:pip install -e ".[train]"(添加 torchcodecbitsandbytes)。
  • 使用提供的 Shell 脚本启动,例如:
    bash scripts/training_scripts/example/low_resource_train.sh
    
  • 所有 LoRA 超参数(秩、目标模块、优化器、卸载策略)均在配置文件中。

评估

  • 仓库包含 evaluation/ 文件夹,提供 11 个指标,涵盖音频质量、唇形同步、AV 对齐等。
  • 提供 Verse-Bench 和人工评分的 Arena 基准测试的预计算结果(732 个样本),以确保可复现性。

生态系统集成

集成 提供的功能
SGLang 通过 sglang generatesglang serve 实现开箱即用的高吞吐量推理。
ComfyUI 社区节点 comfyui-mova 支持可视化编程流水线(支持 I2VA 和 T2VA)。
API studio.mosi.cn 提供托管服务;申请密钥即可无需本地硬件生成视频。
Streamlit 工作流 端到端 UI,可自动生成首帧、重写提示并调用 MOVA。

资源

  • 模型权重 – Hugging Face 集合:MOVA-360pMOVA-720p
  • 技术报告 – arXiv: 2602.08794(2026年2月)。
  • 演示视频 – 请参阅 README 或网站 https://mosi.cn/models/mova
  • 社区 – README 中的徽章栏链接至 Discord、X(Twitter)、飞书群组。
  • 引用 – 学术用途的引用信息已提供在 README 中。

TL;DR

MOVA 是一个公开发布的双塔式视频音频扩散模型,可从文本(以及可选图像)生成短时唇形同步视频。该仓库包含在单个 GPU 上运行推理、使用 LoRA 微调、评估结果以及与 SGLang、ComfyUI 或托管 API 等流行工具集成所需的一切。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目