samuel-vitorino/sopro

A lightweight text-to-speech model with zero-shot voice cloning

何を解決するか

Sopro TTSは、非常に小さなフットプリントで高品質で理解しやすい音声合成(TTS)とボイスクラウンニングを提供することを目的としています。これは、大規模なGPUリソースを必要とせずに、ラップトップCPUやWebブラウザ上で実行可能な効率的で低レイテンシの音声生成のニーズに対応しています。

動作方法

Soproは、120Mパラメータの軽量モデル(sopro-v2-turbo)を使用しており、短い参照音声(5〜20秒)からゼロショットボイスクラウンニングをサポートしています。オフラインパス(最高品質)とストリーミングパス(最小レイテンシ)の2つのモードで動作でき、ラップトップCPU上で音声の最初の出力までの時間(time-to-first-audio)は約300msです。モデルは英語、ヨーロッパポルトガル語、フランス語、ドイツ語をサポートしています。

対象ユーザー

このプロジェクトは、高速でデバイス内でのTTSとボイスクラウンニングを必要とする開発者、およびONNXランタイムを介してブラウザベースの環境に音声合成を統合したい開発者向けです。

主な特徴

  • 小さなフットプリント:120Mパラメータで、ラップトップCPUやブラウザ上で実行可能。
  • ゼロショットクラウンニング:5〜20秒の参照音声からボイスをクラウンニング可能。
  • 多言語対応:英語、ヨーロッパポルトガル語、フランス語、ドイツ語をサポート。
  • 高効率性:M3 CPUおよびH100 GPUで低リアルタイム要因(RTF)を実現。
  • ストリーミング機能:リアルタイム対話に適したストリーミング音声生成をサポート。
  • 因果的ボコーダー:ストリーミングパス用に因果的ボコーダーを内蔵。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト