OpenMOSS/MOVA
MOVA: Towards Scalable and Synchronized Video–Audio Generation
What it solves
MOVA는 고충실도 비디오와 동기화된 오디오를 동시에 생성하도록 설계된 기반 모델입니다. 오디오를 별도로, 종종 맞지 않는 단계로 추가하는 계단식 파이프라인이 필요 없어, 오픈소스 비디오 생성에서 흔히 발생하는 입술 움직임과 사운드 효과의 비동기 문제를 해결합니다.
How it works
MOVA는 비대칭 듀얼 타워 아키텍처를 사용하여 사전 학습된 비디오 타워와 오디오 타워를 결합합니다. 이 타워들은 양방향 교차 어텐션 메커니즘을 통해 융합되어, 단일 추론 패스에서 두 모달리티를 동시에 합성할 수 있습니다. Text-to-Video-Audio (T2VA)와 Image-to-Video-Audio (I2VA) 워크플로를 모두 지원합니다.
Who it’s for
이 프로젝트는 고품질의 동기화된 시청각 콘텐츠가 필요한 AI 연구자, 개발자, 콘텐츠 제작자를 위한 것입니다. 특히 다국어 립싱크나 환경 인식 사운드 효과를 구현하려는 경우에 유용합니다.
Highlights
- Native Bimodal Generation: 한 번의 추론으로 비디오와 오디오를 동시에 생성하여 오류 누적을 방지하고 완벽한 정렬을 보장합니다.
- Precise Lip-Sync: 다국어 립싱크에서 최첨단 성능을 달성합니다.
- Open-Source Ecosystem: 모델 가중치, 추론 코드, 학습 파이프라인 및 LoRA 파인튜닝 스크립트를 제공합니다.
- Broad Integration: 고처리량 추론을 위한 SGLang 지원, 커뮤니티 플러그인을 통한 ComfyUI 통합, 호스팅 API 제공.
- Flexible Hardware Support: VRAM 오프로드 최적화와 Ascend NPU 지원을 포함합니다.