gemelo-ai/vocos

Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis

해결하는 문제

Vocos는 음성 특징(예: 멜스펙트로그램 또는 EnCodec 토큰)에서 고품질 음성 파형을 합성하기 위한 신경 보코더입니다. 시간 영역과 푸리에 기반 신경 보코더 사이의 격차를 메우며, 빠르고 고해상도의 음성 재구성을 제공합니다.

작동 방식

전통적인 GAN 기반 보코더가 시간 영역에서 음성 샘플을 모델링하는 반면, Vocos는 스펙트럼 계수를 생성합니다. 이 계수들은 역 푸리에 변환을 통해 음성 파형으로 변환되며, 단일 순전파로 음성을 생성할 수 있어 빠른 재구성이 가능합니다.

대상 사용자

음성 합성 시스템을 개발하는 연구자 및 개발자, 텍스트-to-음성(TTS) 파이프라인을 구축하는 사람, 또는 Bark와 같은 다른 음성 모델과 통합하고자 하는 사람들을 위한 도구입니다.

주요 특징

  • 빠른 합성: 단일 순전파로 파형을 생성합니다.
  • 스펙트럼 영역 모델링: 시간 영역 모델링 대신 스펙트럼 계수와 역 푸리에 변환을 사용합니다.
  • GAN 기반 학습: 생성적 적대망(GAN) 목적 함수를 사용하여 학습됩니다.
  • 유연한 입력: 멜스펙트로그램과 EnCodec 토큰 모두에서 재구성 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트