jasonppy/VoiceCraft

Zero-Shot Speech Editing and Text-to-Speech in the Wild

해결하는 문제

VoiceCraft는 포드캐스트, 오디오북, 인터넷 영상과 같은 '실제 환경의' 데이터(in-the-wild data)를 사용하여 고품질의 제로샷 음성 편집 및 텍스트-to-음성(TTS)을 수행하는 어려움을 해결합니다. 몇 초의 참조 음성만으로도 익숙하지 않은 목소리를 클론할 수 있어, 텍스트에서 새로운 음성을 생성하거나 기존 오디오 녹음을 수정할 수 있습니다.

작동 방식

VoiceCraft는 토큰 보완 신경 코덱 언어 모델입니다. 음성을 Encodec를 사용하여 토큰 시퀀스로 취급하고, 텍스트 전사와 참조 음성 프롬프트를 기반으로 음성 토큰의 누락된 부분을 '채우는' 언어 모델 방식을 사용합니다. 이 아키텍처는 TTS(음성을 처음부터 생성)와 음성 편집(기존 오디오 클립의 특정 부분을 교체하거나 수정) 모두를 처리할 수 있게 해줍니다.

대상 사용자

  • 오디오 엔지니어 및 콘텐츠 크리에이터: 원래 화자에게 다시 녹음할 필요 없이 음성 오디오를 편집하고 싶은 경우.
  • AI 연구자: 신경 코덱 언어 모델과 제로샷 음성 클론에 관심 있는 분들.
  • 개발자: 스탠드얼론 스크립트 또는 Docker를 통해 고품질 TTS 및 음성 편집 기능을 애플리케이션에 통합하고 싶은 사용자.

주요 특징

  • 제로샷 음성 클론: 몇 초의 참조 음성만으로도 익숙하지 않은 목소리를 클론 가능.
  • 이중 기능성: 텍스트-to-음성 생성과 음성 편집 모두 지원.
  • 실제 환경에서의 성능: 오디오북과 포드캐스트를 포함한 다양한 실제 오디오 데이터로 훈련됨.
  • 유연한 배포: Google Colab, Docker, 스탠드얼론 Python 스크립트 등 다양한 방법으로 추론 실행 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트