FireRedTeam/FireRedTTS3

FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing

何を解決するか

FireRedTTS3 は、広範な言語および方言にわたる高精細なボイスクラウンニングを処理し、自然言語による指示を通じて複雑な音声変更を行うために設計された統合型音声生成・編集システムです。

動作方法

このシステムは意味的に豊かにされた連続音声表現に基づいて構築されており、2つの専門的なバージョンで提供されています:

  • FireRedTTS3-Base:ゼロショットボイスクラウンニングに焦点を当てており、短い参照音声クリップのみを使用してスピーカーの声を模倣できます。
  • FireRedTTS3-Instruct:指示駆動型モデルで、「ボイスデザイン」(テキスト記述に基づいて新しい声を生成)および「音声編集」(既存の音声を意味的または音響的に変更)を可能にします。

高品質を確保するために、ローカルツールまたはLLMで駆動できるテキスト正規化フロントエンドを使用し、複数の言語で書かれたテキストを話される形に変換します。

対象ユーザー

このプロジェクトは、テキストから音声(TTS)、ボイスクラウンニング、音声編集に取り組む開発者および研究者向けであり、24言語および21の中国語方言を扱える多言語システムを必要とする方々に適しています。

主な特徴

  • 広範な言語対応:24言語および21の中国語方言におけるゼロショットクラウンニング。
  • 指示制御によるボイスデザイン:参照音声なしで、年齢、性別、トーン、感情などの記述に基づいてまったく新しい声を生成できる。
  • 自由形式の音声編集:テキスト指示により、語の挿入・削除・置換(意味的編集)および速度・ピッチ・音量の調整(音響的編集)をサポート。
  • 高いパフォーマンス:Seed-TTS-eval および MiniMax-MLS-Test などのベンチマークで、ワード誤り率(WER)およびスピーカー類似度において最先端の結果を示す。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト