samuel-vitorino/sopro
A lightweight text-to-speech model with zero-shot voice cloning
何を解決するか
Sopro TTSは、非常に小さなフットプリントで高品質で理解しやすい音声合成(TTS)とボイスクラウンニングを提供することを目的としています。これは、大規模なGPUリソースを必要とせずに、ラップトップCPUやWebブラウザ上で実行可能な効率的で低レイテンシの音声生成のニーズに対応しています。
動作方法
Soproは、120Mパラメータの軽量モデル(sopro-v2-turbo)を使用しており、短い参照音声(5〜20秒)からゼロショットボイスクラウンニングをサポートしています。オフラインパス(最高品質)とストリーミングパス(最小レイテンシ)の2つのモードで動作でき、ラップトップCPU上で音声の最初の出力までの時間(time-to-first-audio)は約300msです。モデルは英語、ヨーロッパポルトガル語、フランス語、ドイツ語をサポートしています。
対象ユーザー
このプロジェクトは、高速でデバイス内でのTTSとボイスクラウンニングを必要とする開発者、およびONNXランタイムを介してブラウザベースの環境に音声合成を統合したい開発者向けです。
主な特徴
- 小さなフットプリント:120Mパラメータで、ラップトップCPUやブラウザ上で実行可能。
- ゼロショットクラウンニング:5〜20秒の参照音声からボイスをクラウンニング可能。
- 多言語対応:英語、ヨーロッパポルトガル語、フランス語、ドイツ語をサポート。
- 高効率性:M3 CPUおよびH100 GPUで低リアルタイム要因(RTF)を実現。
- ストリーミング機能:リアルタイム対話に適したストリーミング音声生成をサポート。
- 因果的ボコーダー:ストリーミングパス用に因果的ボコーダーを内蔵。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト