2noise/ChatTTS

A generative speech model for daily dialogue.

What it solves

ChatTTS는 LLM 어시스턴트와 같은 일상 대화 시나리오에 특화된 생성 음성 모델입니다. 기존 TTS 모델은 로봇처럼 들리거나 인간 대화의 미묘한 뉘앙스가 부족한 경우가 많지만, ChatTTS는 보다 자연스럽고 표현력이 풍부한 음성 합성을 목표로 합니다.

How it works

ChatTTS는 자동 회귀 방식으로 텍스트에서 오디오를 생성합니다. 중국어와 영어 오디오 데이터를 총 100,000시간 이상 학습했습니다. 오픈소스 버전은 40,000시간 데이터 기반의 사전 학습 모델입니다. [laugh], [uv_break], [lbreak]와 같은 특수 토큰을 통해 운율 특성을 세밀하게 제어할 수 있으며, 스피커 임베딩을 샘플링하여 다중 화자를 지원합니다.

Who it’s for

  • AI Developers: 인간과 같은 음성 출력을 필요로 하는 대화형 AI 에이전트 또는 LLM 어시스턴트를 구축하는 개발자.
  • Researchers: 대화 기반 작업에서 음성 합성 및 운율을 연구하는 학자.
  • Content Creators: 표현력이 풍부하고 대화 중심의 오디오 클립을 생성하고자 하는 사용자.

Highlights

  • Conversational Optimization: 대화에 특화된 튜닝으로 보다 자연스러운 말투 구현.
  • Fine-grained Prosody Control: 웃음, 멈춤, 삽입어 등을 예측하고 제어 가능.
  • Multi-speaker Support: 스피커 임베딩을 통해 다중 화자와 음색 복원을 지원.
  • Bilingual Support: 현재 영어와 중국어를 지원.
  • Streaming Generation: 낮은 지연 시간을 위한 스트리밍 오디오 생성 지원.