resemble-ai/chatterbox

SoTA open-source TTS

해결하는 문제

Chatterbox는 텍스트에서 자연스럽고 대화형 오디오를 생성하기 위해 설계된 오픈소스 음성합성(TTS) 모델의 패밀리입니다. 고성능 GPU에서부터 자원 제약이 있는 CPU에 이르기까지 다양한 하드웨어 환경에서 고품질의 음성 클로닝과 다국어 음성 생성이 가능하도록 지원합니다.

작동 방식

이 프로젝트는 다양한 사용 사례에 맞춘 여러 모델 버전을 제공합니다:

  • Chatterbox-Turbo: 3.5억 파라미터 모델로, 저지연 음성 에이전트에 최적화되어 있으며, 생성 단계를 10단계에서 1단계로 줄이는 디스틸드 디코더를 갖추고 있습니다.
  • Chatterbox-Nano: Turbo 아키텍처의 1.1억 파라미터 버전으로, 디바이스 내 및 CPU 추론에 최적화되어 있으며, 8개의 CPU 코어에서 실시간의 3배 속도로 실행 가능합니다.
  • Chatterbox-Multilingual V3: 5억 파라미터의 일반 목적 모델로, 23개 이상의 언어를 지원하며, 화자 유사도가 향상되고 환각 현상이 감소되었습니다.
  • 단일 언어 팩: 중국어, 힌디어, 스페인어 등 우선 언어를 위한 전용 파인튜닝을 통해 품질 관리와 지역 방언 정확도를 강화합니다.

모든 모델은 참조 오디오 클립을 통해 제로샷 음성 클로닝을 지원하며, 책임 있는 AI 사용을 위해 Perth 시스템을 통한 불가시적 신경 워터마킹을 내장하고 있습니다.

대상 사용자

  • 음성 에이전트 개발자: 인터랙티브 애플리케이션에 저지연, 고음질 음성을 필요로 하는 사용자.
  • 로컬라이제이션 전문가: 다양한 언어 간에 안정적인 음성 클로닝이 필요한 사용자.
  • 에지 디바이스 개발자: CPU 또는 메모리 및 VRAM 제약이 있는 장치에 TTS를 배포하는 사용자.
  • 콘텐츠 제작자: [laugh] 또는 [cough]와 같은 파라링구이스틱 태그를 사용해 내레이션에 현실감을 더하고 싶은 사용자.

주요 특징

  • 다양한 모델 풀: 1.1억에서 5억 파라미터까지 선택 가능하여 속도와 품질의 균형을 조절할 수 있습니다.
  • 내장된 파라링구이스틱 지원: 웃음, 콧방귀 등 비언어적 신호를 음성에 삽입할 수 있습니다.
  • 광범위한 다국어 지원: 23개 이상의 언어를 지원하며, 정밀도를 높이기 위한 전용 단일 언어 파인튜닝이 제공됩니다.
  • CPU 최적화: Nano 모델을 통해 효율적인 디바이스 내 추론이 가능합니다.
  • 책임 있는 AI: 생성된 오디오를 탐지할 수 있는 통합 신경 워터마킹 기능을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트