2noise/ChatTTS

A generative speech model for daily dialogue.

What it solves

ChatTTS は、LLM アシスタントなどの日常的な対話シナリオ向けに設計された生成音声モデルです。従来の TTS モデルはロボットのように聞こえたり、会話特有のニュアンスが欠けていることが多いですが、ChatTTS はより自然で表情豊かな音声合成を目指します。

How it works

ChatTTS はオートレグレッシブ方式でテキストから音声を生成します。中国語と英語の音声データを合計 100,000 時間以上で学習しています。オープンソース版は 40,000 時間分のデータを基にした事前学習モデルです。[laugh][uv_break][lbreak] などの特殊トークンで韻律特徴を細かく制御でき、スピーカー埋め込みをサンプリングすることで複数話者にも対応します。

Who it’s for

  • AI Developers:人間らしい音声出力が必要な対話型 AI エージェントや LLM アシスタントを構築する開発者。
  • Researchers:対話タスクにおける音声合成と韻律を研究する研究者。
  • Content Creators:表情豊かで対話中心の音声クリップを生成したいユーザー。

Highlights

  • Conversational Optimization:対話に特化したチューニングにより、より自然な話し方を実現。
  • Fine-grained Prosody Control:笑い声、ポーズ、間投詞などを予測・制御できる。
  • Multi-speaker Support:スピーカー埋め込みにより複数話者と音色の復元をサポート。
  • Bilingual Support:現在は英語と中国語に対応。
  • Streaming Generation:低遅延のストリーミング音声生成をサポート。