tronghieuit/v-tts
The lightest Vietnamese Text-to-Speech with Multi-Speaker TTS and Zero-Shot Voice Cloning.
解決する課題
V-TTSは、ベトナム語のテキスト読み上げ(TTS)のための軽量で効率的なソリューションを提供します。特に、GPUを必要とせず、標準的なコンシューマー向けハードウェア上で実行可能な高品質な音声合成および音声クローニングのニーズに応えます。
仕組み
このシステムは、シンセサイザー、アイデンティティ抽出用のスピーカーエンコーダー、韻律と感情用のスタイルエンコーダー、そしてピッチとエネルギー用の韻律予測器からなるニューラルアーキテクチャを使用しています。ゼロショットクローニングでは、3〜10秒のリファレンスオーディオクリップから埋め込みを抽出し、その特定の声で音声を生成します。また、北部および南部のダイアレクト(方言)の両方をサポートするために、専用のベトナム語フォネマイザーが含まれています。
対象者
- プロ仕様の録音機器なしでベトナム語のナレーションを必要とするコンテンツクリエイター。
- シンプルなPython APIまたはONNXランタイムを介して、アプリケーションにベトナム語TTSを統合したい開発者。
- スタンドアロンの
.exeアプリケーションによるプラグアンドプレイ体験を求めるWindowsユーザー。
ハイライト
- 超軽量: パラメータ数はわずか74.8Mで、完全にCPUのみで動作可能です。
- ゼロショットクローニング: ファインチューニングなしで、わずか3〜10秒のリファレンスオーディオを使用してあらゆる音声をクローンできます。
- 高いパフォーマンス: CPU上でリアルタイムの3〜4倍の推論速度を実現します。
- 方言サポート: 北部および南部のベトナム語音声の組み込みサポート。
- 柔軟なデプロイ: Windowsアプリ、Dockerコンテナ、Pythonパッケージ、およびWebやAndroid向けのONNXエクスポートとして利用可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト