tronghieuit/v-tts

The lightest Vietnamese Text-to-Speech with Multi-Speaker TTS and Zero-Shot Voice Cloning.

解決する課題

V-TTSは、ベトナム語のテキスト読み上げ(TTS)のための軽量で効率的なソリューションを提供します。特に、GPUを必要とせず、標準的なコンシューマー向けハードウェア上で実行可能な高品質な音声合成および音声クローニングのニーズに応えます。

仕組み

このシステムは、シンセサイザー、アイデンティティ抽出用のスピーカーエンコーダー、韻律と感情用のスタイルエンコーダー、そしてピッチとエネルギー用の韻律予測器からなるニューラルアーキテクチャを使用しています。ゼロショットクローニングでは、3〜10秒のリファレンスオーディオクリップから埋め込みを抽出し、その特定の声で音声を生成します。また、北部および南部のダイアレクト(方言)の両方をサポートするために、専用のベトナム語フォネマイザーが含まれています。

対象者

  • プロ仕様の録音機器なしでベトナム語のナレーションを必要とするコンテンツクリエイター
  • シンプルなPython APIまたはONNXランタイムを介して、アプリケーションにベトナム語TTSを統合したい開発者
  • スタンドアロンの .exe アプリケーションによるプラグアンドプレイ体験を求めるWindowsユーザー

ハイライト

  • 超軽量: パラメータ数はわずか74.8Mで、完全にCPUのみで動作可能です。
  • ゼロショットクローニング: ファインチューニングなしで、わずか3〜10秒のリファレンスオーディオを使用してあらゆる音声をクローンできます。
  • 高いパフォーマンス: CPU上でリアルタイムの3〜4倍の推論速度を実現します。
  • 方言サポート: 北部および南部のベトナム語音声の組み込みサポート。
  • 柔軟なデプロイ: Windowsアプリ、Dockerコンテナ、Pythonパッケージ、およびWebやAndroid向けのONNXエクスポートとして利用可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト