Audio8-AI/Audio8_TTS

SOTA-Class TTS at Compact Scale

何を解決するか

Audio8_TTS は、高品質な音声生成とゼロショット音声クローンを実現する、コンパクトで多言語対応の音声合成(TTS)システムです。短い参照音声クリップから特定の発話者の声を再現するための追加学習を必要とせず、効率的でパラメータ数が少ないモデルのニーズに応えます。

動作方法

このシステムは、DualAR(Dual Autoregressive)アーキテクチャを使用しています。"遅い" ARトランスフォーマーが音声フレームの意味トークンを予測し、その後、"速い" ARトランスフォーマーがコーデックコードブックを予測します。モデル自体にニューラルコーデックを内蔵しており、別途のモデルを必要としません。主に2つのサイズで提供されています:0.6Bパラメータのプレビュー版と、Falcon-H1ハイブリッドバックボーン(Mamba 2 SSM + アテンション)を活用する、非常にポータブルな0.1Bパラメータ版です。

対象ユーザー

ゼロショット音声クローンをサポートし、CPU(ONNX Runtime経由)や高性能GPUサーバー(SGLang Omniサービング)など、さまざまなハードウェアにデプロイ可能な軽量な多言語TTSソリューションを求める開発者や研究者向けです。

特徴

  • ゼロショット音声クローン:参照音声クリップとそのトランスクリプトから声を模倣します。
  • 多言語対応:英語、中国語、日本語、韓国語、スペイン語、フランス語、ドイツ語、イタリア語、オランダ語、ポーランド語など、11言語に最適化されています。
  • 効率的なデプロイ:ONNX INT4によるCPUデプロイと、ページ化アテンションや動的バッチ処理を備えたSGLang Omni(高スループットサービング)をサポートします。
  • コンパクトなサイズ:パラメータ数が大幅に少ない(0.6B vs 1.5B–8.5B)にもかかわらず、Seed-TTSなどの複数のベンチマークでより優れた性能を発揮しています。
  • SFTパイプライン:さらなる適応のための独立した教師あり微調整パイプラインを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト