SonyResearch/Woosh
Public release of the Sound Effect Foundation model by Sony AI.
해결하는 문제
Woosh는 고품질 사운드 이펙트를 생성하기 위해 설계된 생성 모델 세트입니다. 텍스트 설명 기반의 오디오 생성(텍스트에서 오디오) 또는 비디오 시퀀스와 동기화된 오디오 생성(비디오에서 오디오)의 과제를 해결합니다.
작동 방식
이 프로젝트는 Latent Diffusion Models (LDMs) 및 보조 구성 요소의 세트를 사용합니다:
- Woosh-AE: 원시 오디오와 잠재 표현 간의 변환을 처리하는 오디오 인코더/디코더입니다.
- Woosh-CLAP: 다중 모달 정렬 모델로, 확산 모델의 조건부 입력을 위한 텍스트-오디오 토큰 잠재를 제공합니다.
- Woosh-Flow 및 Woosh-DFlow: 텍스트 프롬프트에서 오디오를 생성하거나 조건 없이 생성하는 모델입니다.
- Woosh-VFlow: 비디오 시퀀스에 특화된 다중 모달 LDM으로, 선택적 텍스트 프롬프트를 사용하여 오디오를 생성합니다.
대상 사용자
이 툴킷은 미디어 제작을 위한 자동 사운드 이펙트 생성에 관심이 있는 사운드 디자이너, 비디오 에디터, AI 연구자를 대상으로 합니다.
주요 특징
- 텍스트에서 오디오 (T2A): 텍스트 설명에서 사운드 이펙트를 생성합니다.
- 비디오에서 오디오 (V2A): 비디오의 시각 콘텐츠에 맞는 오디오를 생성합니다.
- 다중 모달 조건부 입력: 비디오와 텍스트 프롬프트를 결합하여 오디오 생성이 가능합니다.
- 오픈 웨이트: 공개 데이터셋용 사전 학습된 가중치가 제공됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트