JavisVerse/JavisDiT
[ICLR 2026] Official implementation of JavisDiT and JavisDiT++ series.
해결하는 문제
JavisDiT++는 텍스트 프롬프트 기반으로 음성과 영상이 의미적·시간적으로 일치하는 영상을 생성하는 데 어려움을 겪는 Joint Audio-Video Generation (JAVG) 문제를 해결하기 위해 설계되었습니다.
작동 방식
이 프로젝트는 Diffusion Transformer (DiT) 아키텍처를 사용하여 소리가 나는 영상을 생성합니다. 다음과 같은 주요 기술적 혁신을 채택하고 있습니다:
- Joint Self-Attention: 생성 과정에서 음성과 영상 모달 간의 밀접한 상호작용을 가능하게 합니다.
- Modality-Specific MoE (MS-MoE): 각 모달 내 표현을 정교화하여 품질을 향상시킵니다.
- Temporally Aligned Rotary Position Encoding (TA-RoPE): 음성과 영상 토큰 간의 세밀한 동기화를 보장합니다.
- AV-DPO: 인간의 선호에 맞춰 생성된 출력을 조정하기 위한 Direct Preference Optimization 기법입니다. 품질과 동기화 향상에 기여합니다.
대상 사용자
다중 모달 AI에 종사하는 연구자 및 개발자, 특히 텍스트에서 음성-영상 생성 및 다양한 감각 모달 간 동기화에 관심이 있는 분들에게 적합합니다.
주요 특징
- 통합 모델링: 음성과 영상 생성을 하나의 최적화된 프레임워크로 통합합니다.
- 다단계 학습: 음성 사전학습 → 음성-영상 SFT → 최종 DPO를 통한 선호도 조정까지 지원하는 파이프라인입니다.
- 선호도 데이터셋: 인간의 선호도에 맞추기 위한 AV-DPO 선호도 데이터셋을 포함합니다.
- 평가 세트: 음성-영상 일치성과 품질을 종합적으로 평가할 수 있는 JavisBench를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트