2noise/ChatTTS

A generative speech model for daily dialogue.

What it solves

ChatTTS 是一個專為日常對話情境(如 LLM 助手)設計的生成式語音模型。它旨在提供比傳統 TTS 模型更自然、更具表情的語音合成,傳統模型往往聽起來機械,缺乏人類語音的對話細微差別。

How it works

ChatTTS 使用自回歸式系統從文字生成音訊。模型以超過 100,000 小時的中英文音訊資料進行訓練。開源版本是基於 40,000 小時資料的預訓練模型。它透過特殊標記(如 [laugh][uv_break][lbreak])提供對韻律特徵的細緻控制,並可透過抽樣說話者嵌入支援多說話者。

Who it’s for

  • AI Developers:建構需要類人聲音輸出的對話式 AI 代理或 LLM 助手。
  • Researchers:研究對話任務中語音合成與韻律的學者。
  • Content Creators:想要產生富有表情、對話驅動的音訊片段的使用者。

Highlights

  • Conversational Optimization:專為對話調校,實現更自然的語音模式。
  • Fine-grained Prosody Control:可預測與控制笑聲、停頓與插入語。
  • Multi-speaker Support:支援多說話者,並可透過說話者嵌入恢復音色。
  • Bilingual Support:目前支援英語與中文。
  • Streaming Generation:支援串流音訊生成,降低延遲。