OpenMOSS/MOVA
A foundation model that generates synchronized video and audio in a single model
MOVA란 무엇인가요?
MOVA (MOSS Video Audio)는 단일 프로세스 내에서 동기화된 동영상과 오디오를 생성하는 오픈소스 기반 모델입니다. 텍스트 프롬프트(선택적으로 참조 이미지 포함)를 입력하면, 말하는 내용과 입술 움직임이 일치하고, 배경 음향이 장면에 어울리는 짧은 동영상을 출력할 수 있습니다.
핵심 아이디어
| 기능 | 왜 중요한가 |
|---|---|
| 내장된 이중 모달 생성 | 별도의 텍스트 → 동영상 + 텍스트 → 오디오 파이프라인 없음. 모델이 두 모달을 동시에 생성하여 오차 누적이 발생하지 않음. |
| 비대칭 이중 타워 아키텍처 | 사전 학습된 동영상 인코더와 오디오 인코더가 양방향 크로스 어텐션을 통해 상호 소통. 풍부한 다중 모달 상호작용 가능. |
| 립싱크 및 사운드 이펙트 | Verse-Bench 벤치마크에서 입증된 최첨단 다국어 리프싱크 및 환경 인식 오디오 생성. |
| 완전한 오픈소스 | 모델 가중치, 추론 코드, 학습 파이프라인, LoRA 미세조정 스크립트, 평가 세트, 공개 API 모두 공개. |
| 하드웨어 유연성 | GPU, NVIDIA H100/RTX 4090, Ascend NPU, 제한된 VRAM 환경에서도 작동 가능한 오프로드 전략 지원. |
시작하기 (빠른 시작)
- 환경 생성
conda create -n mova python=3.13 -y conda activate mova pip install -e . - 체크포인트 다운로드 (예: 360p) Hugging Face에서:
hf download OpenMOSS-Team/MOVA-360p --local-dir /path/to/MOVA-360p - 추론 실행 – 단일 인물 예시:
다중 인물 장면의 경우 프롬프트와export CP_SIZE=1 export CKPT_PATH=/path/to/MOVA-360p torchrun --nproc_per_node=$CP_SIZE \ scripts/inference_single.py \ --ckpt_path $CKPT_PATH \ --cp_size $CP_SIZE \ --height 352 --width 640 \ --prompt "A man in a blue blazer …" \ --ref_path ./assets/single_person.jpg \ --output_path ./data/samples/single_person.mp4 \ --seed 42 \ --offload cpu--ref_path를 변경하세요.
미세조정 방법 (LoRA)
configs/training/내 설정 파일 중 하나 선택 (저자원, accelerate, 8GPU용 accelerate + FSDP).- 학습용 추가 패키지 설치:
pip install -e ".[train]"(torchcodec, bitsandbytes 포함). - 제공된 쉘 스크립트로 실행 예:
bash scripts/training_scripts/example/low_resource_train.sh - 모든 LoRA 하이퍼파라미터 (랭크, 타겟 모듈, 옵티마이저, 오프로드 전략)는 설정 파일에 포함되어 있음.
평가
- 리포지토리에는 11개의 메트릭을 포함한
evaluation/폴더가 포함되어 있으며, 오디오 품질, 리프싱크, AV 정렬 등을 평가. - 재현성을 위해 Verse-Bench와 인간 평가 기반 Arena 벤치마크(732개 샘플)의 사전 계산 결과 제공.
생태계 통합
| 통합 | 제공되는 기능 |
|---|---|
| SGLang | sglang generate 또는 sglang serve를 통해 당일 고처리량 추론 가능. |
| ComfyUI | 커뮤니티 노드 comfyui-mova를 통해 시각적 프로그래밍 파이프라인 제공 (I2VA 및 T2VA 모두 지원). |
| API | studio.mosi.cn에서 호스팅된 서비스. 로컬 하드웨어 없이 비디오 생성을 위한 키 신청 가능. |
| Streamlit 워크플로우 | 엔드투엔드 UI로 첫 프레임 자동 생성, 프롬프트 재작성, MOVA 호출 가능. |
리소스
- 모델 가중치 – Hugging Face 컬렉션:
MOVA-360p,MOVA-720p. - 기술 보고서 – arXiv: 2602.08794 (2026년 2월).
- 데모 비디오 – README 또는 웹사이트
https://mosi.cn/models/mova참조. - 커뮤니티 – 배지 바에 연결된 Discord, X (Twitter), Feishu 그룹.
- 인용 – 학술용으로 README에 제공.
TL;DR
MOVA는 텍스트(옵션으로 이미지)에서 짧고 리프싱크된 동영상을 생성할 수 있는 공개된 이중 타워형 비디오 오디오 확산 모델입니다. 단일 GPU에서 추론을 실행하고, LoRA로 미세조정하며, 결과를 평가하고, SGLang, ComfyUI, 호스팅 API와 같은 인기 도구에 쉽게 통합할 수 있는 모든 것이 리포지토리에 포함되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트