index-tts/index-tts

An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System

해결하는 문제

IndexTTS는 단 하나의 참조 오디오 클립만 사용하여 특정 목소리를 복제하도록 설계된 제로샷 텍스트 음성 변환(TTS) 시스템입니다. 각 새로운 목소리에 대해 방대한 학습 데이터가 필요하지 않으면서도 여러 언어에 걸쳐 고충실도 및 제어 가능한 음성 합성에 대한 요구를 해결합니다.

작동 원리

이 시스템은 자기회귀 모델을 사용하여 음성을 합성합니다. 사용자는 음색(목소리의 고유한 특성)을 위한 참조 오디오 클립을 제공할 수 있으며, 선택적으로 별도의 감정 참조 오디오 또는 감정 벡터를 사용하여 말의 분위기를 제어할 수 있습니다. 최신 버전인 IndexTTS-2.5는 중국어, 영어, 일본어, 스페인어, 아랍어를 지원하며, 음소(Pinyin, CMU 및 일본어 Kana)를 통해 말하기 속도와 발음에 대한 세밀한 제어 기능을 포함합니다.

대상 사용자

이 도구는 다국어 복제, 정밀한 감정 표현 및 프로덕션 수준의 배포(vLLM을 통해 지원)를 지원하는 산업 수준의 TTS 시스템을 찾는 개발자와 연구자를 대상으로 합니다.

주요 특징

  • Zero-Shot Cloning: 단일 오디오 샘플에서 목소리를 복제합니다.
  • 다국어 지원: 중국어, 영어, 일본어, 스페인어, 아랍어를 지원합니다.
  • 세밀한 제어: 감정 강도, 말하기 속도(0.5x ~ 2.0x) 및 음소를 사용한 특정 발음에 대한 제어를 제공합니다.
  • 유연한 감정 입력: 감정은 참조 오디오, 사전 정의된 감정 벡터 또는 텍스트 자체에서 자동으로 유도하여 제어할 수 있습니다.
  • 프로덕션 준비 완료: 효율적인 서빙을 위해 vLLM과 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트