neuphonic/neutts
On-device TTS model by Neuphonic
解決する課題
NeuTTSは、高品質なテキスト読み上げ(TTS)をクラウドベースのAPIからローカルデバイスへと移行するために設計されています。スマートフォン、ノートパソコン、Raspberry Piのような組み込みデバイス上で、常時インターネット接続を必要とせずに実行できる、軽量で自然な音声モデルを提供し、プライバシーの向上と低遅延を実現します。
仕組み
このシステムは、テキスト理解に最適化された小型のLLMバックボーンと、NeuCodecと呼ばれるニューラルオーディオコーデックを組み合わせて使用しています。このアーキテクチャにより、モデルはテキストを処理してオーディオトークンを生成し、コーデックがそれを可聴音声に変換します。また、短い(3〜15秒)音声サンプルとその対応するテキストをリファレンスとして使用し、特定の声を模倣する即時ボイスクローニングをサポートしています。
対象ユーザー
組み込み音声エージェント、ローカルAIアシスタント、スマート玩具、およびオンデバイス処理が不可欠なコンプライアンス重視のアプリケーションを開発している開発者向けに構築されています。
ハイライト
- オンデバイス最適化: モバイルおよび組み込みハードウェアでの効率的な推論のために、GGUF量子化を提供します。
- 即時ボイスクローニング: わずか3秒の音声を使用して音声をクローンする機能。
- 多言語サポート: 英語、スペイン語、ドイツ語、フランス語のモデルが利用可能です。
- 感情制御: NeuTTS-2Eモデルは、固定のスピーカーに対して特定の感情表現(例:喜び、悲しみ、怒り)を可能にします。
- リアルタイム性能: 中スペックのデバイスでリアルタイム生成が可能です。
- 組み込みのセキュリティ: 悪用を防ぐため、生成された音声に知覚閾値ウォーターマーキングが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト