netease-youdao/Confucius4-TTS

Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine

What it solves

Confucius4‑TTS は、高品質な多言語音声合成において、話者のアイデンティティを異なる言語間で保持するという課題を解決します。"ゼロショット" 音声クローンを可能にし、短い音声サンプルだけで追加学習や参照音声の文字起こしなしに声を再現できます。

How it works

システムは「音声エンコーダ + 大規模言語モデル (LLM)」アーキテクチャを採用し、主に 2 つのステージで動作します。

  1. Text2Semantic (T2S):LLM ベースのステージで、入力テキストと話者条件からセマンティックトークン列を生成します。
  2. Semantic2Acoustic (S2A):フローマッチングモデルがセマンティックトークンをメルスペクトログラムに変換し、最終的に波形へと変換します。

性能向上のため、プロジェクトは vLLM バックエンドをサポートし、PagedAttention を用いて LLM ステージを高速化します。

Who it’s for

このツールは、音声合成、ローカリゼーション、音声クローンに取り組む開発者や研究者向けで、14 のサポート言語(中国語、英語、日語、韓国語、ドイツ語、フランス語、スペイン語など)に対応しています。

Highlights

  • Cross-Lingual Transfer:ターゲット言語でアクセントのない音声を合成しつつ、元の話者の声を保持。
  • Zero-Shot Cloning:参照 WAV ファイルから文字起こし不要で即座に声をクローン。
  • Emotion Transfer:参照音声の感情トーンをクローン可能。
  • Broad Language Support:標準で 14 言語をサポート。
  • Flexible Deployment:Gradio Web UI、Python API、FastAPI サーバーを提供し、ストリーミング・非ストリーミングの音声生成の両方に対応。