Ampixa/sanoTTS

sanoTTS (सानो = 'small' in Nepali): a ~1.4M-param neural TTS that runs on a $3 chip or in the browser. Leads SCOREQ/UTMOS in the sub-15M class.

何を解決するか

sanoTTS は、クラウド接続や専用のニューラル処理ユニット(NPU)、サーバーを必要とせずに、低消費電力のハードウェア上でローカルで実行できる、非常に小型なニューラル音声合成(TTS)ボイスのファミリーを提供します。これは、$3 の ESP32-S3 マイコンや WebAssembly(WASM)を介してブラウザ内で直接実行可能なリアルタイム音声合成を可能にします。

仕組み

このシステムは、複数段階のパイプラインを使用しています:espeak-ng フォネミザがテキストをフォネムIDに変換し、期間モデルがタイミングを予測し、音響モデルが生成器の潜在変数を予測し、デコーダーが最終的な音声をレンダリングします。ターゲットプラットフォームに応じて、異なるデコーダーを使用します:ブラウザ向けにはコンパクトな時間領域デコーダー(fp32 WASM)、マイコン向けには量子化された int8 iSTFT デコーダーを用いて、リアルタイム性能を確保します。

対象ユーザー

  • 組み込み開発者:安価なマイコン上で音声対応デバイスを開発したい方。
  • Web開発者:ウェブサイトにクライアントサイド、サーバーレスTTSを追加したい方。
  • Python開発者:軽量で依存関係のないTTSライブラリを探している方。

特徴

  • 極めてコンパクトなサイズ:モデルのパラメータ数は 294k から 2.3M まで、最小のモデル(heart-nano)はわずか 337 KB です。
  • 広範な言語対応:英語、スペイン語、フランス語、アラビア語、ネパール語を含む 16 言語に 30 のボイスをサポート。
  • 高い効率性:ESP32-S3 で 0.383 のリアルタイム係数(RTF)を達成し、リアルタイムより 2.6 倍速く音声合成が可能です。
  • 依存関係ゼロ:Pythonパッケージは推論に純粋な numpy を使用し、ブラウザ版は完全にクライアントサイドで動作します。
  • カスタマイズ可能:ユーザーが独自のボイスを生成・蒸留するための完全なトレーニングレシピを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト