MisoLabsAI/MisoTTS

Miso TTS is an 8 billion, highly emotive text-to-speech model

解決する課題

Miso TTS 8Bは、高品質な会話形式の英語音声生成のために設計されています。ユーザーはテキストを自然な対話に変換でき、既存の音声を使用してボイスクローニングを行うことも可能です。

仕組み

このモデルは、Sesame CSMアーキテクチャに触発されたRVQ Transformerアーキテクチャを採用しています。主に2つのコンポーネントで構成されています:

  • テキストとオーディオフレームの埋め込みを処理する、大規模なLlama 3.2スタイルのバックボーン(8Bパラメータ)。
  • 各フレーム内の高次オーディオコードブックを予測する、より小規模な自己回帰型オーディオデコーダー(300Mパラメータ)。

Mimiオーディオトークナイザーを利用し、テキストとオプションのオーディオコンテキストからオーディオコードを生成するため、会話の履歴を維持した、より自然な音声生成が可能です。

対象者

会話形式の対話とボイスクローニングが可能な高忠実度テキスト読み上げシステムを必要とし、かつ高VRAM GPU(例:bfloat16精度には24GB以上のVRAM)を利用可能な開発者および研究者。

ハイライト

  • 会話重視: 単なる読み上げではなく、対話生成に特化して設計されています。
  • ボイスクローニング: 既存の音声サンプルを条件付けすることで、プロンプトによる生成をサポートします。
  • ウォーターマーキング: 安全性と真正性のために、デフォルトのウォーターマーキングが含まれています。
  • Llamaベースのアーキテクチャ: 大規模なTransformerバックボーンを活用し、高品質な出力を実現します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト