netease-youdao/Confucius4-TTS

Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine

何を解決するか

Confucius4-TTSは、複数言語で高品質な音声合成を行う際、同一話者の声の特徴を維持するという課題に対処します。特に「ゼロショット」音声クローンという問題を解決し、短い参照音声クリップから声を模倣できるようにし、そのクリップのテキストトランスクリプトや新しい話者向けの追加学習を必要としません。

動作方法

このシステムは「音声エンコーダ + 大規模言語モデル(LLM)」アーキテクチャを採用し、主に2つの段階に分かれています:

  1. Text2Semantic (T2S):入力テキストと話者条件に基づいて、意味トークン列を生成する自己回帰型LLM。
  2. Semantic2Acoustic (S2A):これらの意味トークンをメルスペクトログラムに変換し、最終的な音声合成を行うフローマッチングモデル。

パフォーマンス最適化のため、T2S生成段階をvLLMバックエンドとPagedAttentionで加速できます。外部コンポーネントとしてWav2Vec2-BERTによる意味特徴抽出とBigVGANによるニューラルボコーダーを活用しています。

対象ユーザー

このツールは、多言語アプリケーションに取り組む開発者や研究者、複数言語で一貫した音声クローンが必要なコンテンツクリエイター、自然で表現豊かでアクセントのない多言語出力を必要とするAI駆動音声合成システムの構築者に最適です。

特徴

  • 14言語対応:中国語、英語、日本語、韓国語、ドイツ語、フランス語、スペイン語、インドネシア語、イタリア語、タイ語、ポルトガル語、ロシア語、マレー語、ベトナム語に対応。
  • トランスクリプト不要のクローン:参照音声ファイルのみで音声クローンが可能。参照音声のテキストトランスクリプトは不要。
  • 多言語間転送:話者が知らない言語でも、独自の声の特徴を維持し、不自然なアクセントを避けながら「話す」ことが可能。
  • 感情転送:声のトーンだけでなく、参照音声の感情や雰囲気もクローン可能。
  • 柔軟なデプロイ:Python API、Gradioウェブインターフェース、およびストリーミング・非ストリーミング音声生成に対応するFastAPIサーバーを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト