Mistral AI Voxtral TTS リリース

Mistral AIは、高忠実度かつ多言語の音声生成を目的として設計された4Bパラメータのテキスト読み上げ(TTS)モデル、Voxtral TTSをリリースしました。このモデルは、低遅延で現実的かつ感情豊かな音声を生成するように設計されており、スケーラブルなエンタープライズ向け音声エージェントやリアルタイムの対話に適しています。

高い自然度を持つ多言語音声生成

Voxtral TTSは、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語にわたって最先端のパフォーマンスをサポートしています。このモデルは、文化的なニュアンス、自然なリズム、そして感情的な器用さに焦点を当てており、ロボットのような話し方を避けるために、文脈(皮肉や喜びなど)を解釈する能力を含んでいます。

音声エミュレーションと適応

Voxtral TTSは、わずか3秒の参照サンプルを使用して、カスタム音声に適合させることができます。この適応は、話者の声だけでなく、以下のような特定のニュアンスも捉えます:

  • 微妙なアクセント
  • 抑揚とイントネーション
  • 参照オーディオに含まれる非流暢性

特筆すべきは、このモデルがゼロショットの言語横断的な音声適応を実現している点です。ある言語で音声を生成しながら、別の言語で提供された音声プロンプトのアクセントを採用することができます(例:フランス語の音声プロンプトを使用して、自然なフランス語アクセントの英語を生成する)。

パフォーマンス・ベンチマークと人間による評価

単語誤り率(word-error-rate)のような自動指標では音声の自然度を完全に捉えることができないため、Mistral AIはネイティブスピーカーによる比較的な人間による評価を活用しました。

  • 自然度: 人間による評価では、Voxtral TTSは、Time-to-First-Audio (TTFA) を同程度に維持しながら、ElevenLabs Flash v2.5と比較して優れた自然度を達成していることが示されています。
  • 品質: このモデルは、特に、生き生きとした対話のための感情制御(emotion-steering)のサポートにおいて、ElevenLabs v3と同等の性能を発揮します。
  • ゼロショット・カスタム音声: サポートされている9言語にわたる並行比較テストにおいて、Voxtral TTSは、ゼロショットの多言語カスタム音声設定において、ElevenLabs v2.5 Flashよりも広い品質の差を示しました。

技術的アーキテクチャ

Voxtral TTSは、Ministral 3Bをバックボーンとする、トランスフォーマーベースの自己回帰型フロー・マッチング・モデルです。アーキテクチャは、主に3つのコンポーネントで構成されています:

  1. Transformer Decoder Backbone: 3.4B parameters.
  2. Flow-Matching Acoustic Transformer: 390M parameters.
  3. Neural Audio Codec: 300M parameters (symmetric encoder-decoder).

処理ワークフロー: このモデルは、音声プロンプト(5秒から25秒)とテキストプロンプトを受け取ります。トランスフォーマー・バックボーンは、各オーディオ・フレームに対してセマンティック・トークンを予測します。次に、フロー・マッチング・トランスフォーマーが16回の関数評価(NFEs)を行い、音響的潜在変数(acoustic latent)を生成します。独自のコーデックが、12.5Hzのフレームレートで、セマンティック VQ (8192 vocabulary) と音響的 FSQ (36 dim and 21 levels) 潜在変数を使用して、音声を因果的に処理します。

遅延とストリーミング機能

リアルタイムの音声エージェント・アプリケーション向けに設計されたVoxtral TTSは、低遅延ストリーミングに最適化されています:

  • モデル遅延: 500文字の典型的な入力(10秒のオーディオ)に対して70ms。
  • Real-Time Factor (RTF): 約9.7x。
  • 生成長: モデルはネイティブで最大2分間のオーディオを生成できます。APIは、スマート・インターリービング(smart interleaving)を介して、より長い生成をサポートしています。

エンタープライズ統合と可用性

Voxtral TTSは、エンタープライズ向け音声パイプラインの出力層として位置付けられており、Voxtral Transcribeと統合して完全な音声対音声(speech-to-speech)ワークフローを実現するか、既存の音声からテキストへの変換(speech-to-text)やLLMスタックと統合することが可能です。

アクセスと価格設定:

  • API Access: $0.016 per 1k characters.
  • Testing: Mistral Studio と Le Chat で利用可能です。
  • Open Weights: いくつかの参照音声を含むバージョンは、Hugging Face 上で CC BY NC 4.0 ライセンスの下で利用可能です。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch