2noise/ChatTTS

A generative speech model for daily dialogue.

What it solves

ChatTTS 是一个专为日常对话场景(如 LLM 助手)设计的生成式语音模型。它旨在提供比传统 TTS 模型更自然、更具表情的语音合成,传统模型往往听起来机械,缺乏人类语音的对话细微差别。

How it works

ChatTTS 使用自回归式系统从文字生成音频。模型以超过 100,000 小时的中英文音频数据进行训练。开源版本是基于 40,000 小时数据的预训练模型。它通过特殊标记(如 [laugh][uv_break][lbreak])提供对韵律特征的细致控制,并可通过抽样说话者嵌入支持多说话者。

Who it’s for

  • AI Developers:构建需要类人声音输出的对话式 AI 代理或 LLM 助手。
  • Researchers:研究对话任务中语音合成与韵律的学者。
  • Content Creators:想要生成富有表情、对话驱动的音频片段的用户。

Highlights

  • Conversational Optimization:专为对话调校,实现更自然的语音模式。
  • Fine-grained Prosody Control:可预测与控制笑声、停顿与插入语。
  • Multi-speaker Support:支持多说话者,并可通过说话者嵌入恢复音色。
  • Bilingual Support:目前支持英语和中文。
  • Streaming Generation:支持流式音频生成,降低延迟。