Edge0-AI/Audio8_TTS
SOTA-Class TTS at Compact Scale
何を解決するか
Audio8_TTS は、高品質な音声生成とゼロショットボイスクラウンニングを実現する、コンパクトで多言語対応の音声合成(TTS)システムです。新しい話者に対して追加の学習を必要とせずにボイスクラウンディングを可能にする強力かつポータブルなモデルを提供することを目指しており、パラメータ数を極めて小さく(0.6B または 0.1B)保っています。
動作原理
このシステムは、DualAR(Dual Autoregressive)アーキテクチャを使用しています。"Slow AR" と呼ばれるトランスフォーマーは、各音声フレームの意味トークンを予測し、"Fast AR" と呼ばれるトランスフォーマーは、Slow の隠れ状態と過去のコードブックに基づいてコーデックコードブックを予測します。モデル自体が波形復元用のニューラルコーデックを内包しており、別途モデルを必要としません。
0.1B バージョンでは、純粋なアテンションベースのSlow ARバックボーンが Falcon-H1 ハイブリッド(Mamba 2 SSM + アテンション)に置き換えられ、さらにサイズを縮小し効率を向上させています。
対象ユーザー
- アプリケーションに統合するための軽量でポータブルなTTSモデルを探している 開発者。
- ゼロショットボイスクラウンディングや効率的なARアーキテクチャに興味がある 研究者。
- 複数言語(英語、中国語、日本語、韓国語、およびいくつかのヨーロッパ言語を含む)で高品質な音声合成が必要な uma l ユーザー。
特徴
- ゼロショットボイスクラウンディング:短い参照音声とそのトランスクリプトのみでボイスをクローン可能。
- コンパクトなサイズ:0.6B および 0.1B パラメータバージョンで提供され、非常に効率的。
- 多言語対応:広く最適化された11言語(広東語、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポーランド語、スペイン語)。
- 高いパフォーマンス:Seed-TTS および CV3 などのベンチマークで、はるかに大きなSOTAモデルと同等の性能を発揮。
- デプロイオプション:CPU ONNX Runtime(INT4)による低メモリデプロイと、SGLang Omni サービングによる高スループット、OpenAI互換APIサーバーをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト