Hugging Face Open TTS リーダーボード

Hugging Face は、多言語テキストから音声への変換(TTS)モデルおよびボイスクラーニングモデルの評価を標準化するためのスケーラブルな評価フレームワークである Open TTS リーダーボードを導入しました。人間中心のアリーナ投票を遅いものから客観的なメトリクスに置き換えることで、モデルの評価に要する時間を数週間から数時間に短縮しています。

客観的評価メトリクス

Open TTS リーダーボードは、モデルのパフォーマンスをさまざまな次元で評価するために、3つの主要な客観的メトリクスを使用しています。

  • 音声の明瞭さ: Word Error Rate (WER) と Character Error Rate (CER) を用いて測定されます。リーダーボードでは、生成された音声を Qwen3 ASR で音声認識し、元のプロンプトと比較しています。
  • 速度: バッチ処理されたオフライン推論の Inverse Real-Time Factor (RTFx) と、ストリーミング遅延(バッチサイズ 1)の Time-to-First-Audio (TTFA) で評価され、H200 GPU および CPU でテストされています。
  • 話者類似度: 生成された音声と参照音声クリップの WavLM 話者埋め込み間のコサイン類似度(SIM)で測定されます。

多言語対応およびボイスクラーニング機能

リーダーボードは、英語および多言語性能の専用ランキングを提供しており、Seed TTS Eval および CV3 Eval のデータセットを利用しています。

英語性能

hexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-pro などのモデルが、英語の WER で現在リードしています。プラットフォームには、WER、バッチ推論速度(RTFx)、モデルサイズのトレードオフを可視化するパレートプロットが含まれています。

多言語性能

英語の性能は他の言語の指標として信頼できないため、リーダーボードでは多言語ランキングの切り替えが可能です。k2-fsa/OmniVoice、fishaudio/s2-pro、FunAudioLLM/Fun-CosyVoice3-0.5B-2512 は強力な多言語モデルとして特定されています。漢字ベースの言語(中国語、日本語、韓国語)については、WER の代わりに CER が報告されます。

ボイスクラーニング

"ボイスクラーニング" のトグルを有効にすると、ゼロショットボイスクラーニングをサポートするモデル同士が比較されます。bosonai/higgs-tts-3-4b や openbmb/VoxCPM2 などのモデルは、参照音声クリップが提供された場合、平均 WER が向上することが示されています。

ストリーミング性能と遅延

"ストリーミング" タブは、インタラクティブな音声エージェントにとって重要な Time-to-First-Audio (TTFA) に焦点を当てています。

  • ストリーミングモデル: TTFA は最初の音声チャンクが到着するまでの時間を測定します。
  • 非ストリーミングモデル: TTFA は、再生を開始する前に全発話の生成に要する時間を測定します。

テストは、CV3-Eval からの 50 件の英語プロンプトを H200 GPU および CPU で実施しています。kyutai/pocket-tts は、両方のハードウェア構成においてストリーミング性能が優れているモデルとして強調されています。

人間の好みとコミュニティ連携

客観的メトリクスはスケーラビリティを提供しますが、Hugging Face は人間の好みが自然さや表現力の最終的な判断基準であると認識しています。このギャップを埋めるために、リーダーボードには「聞く」タブが含まれており、ユーザーは生成された出力を比較し、フィードバックを提供できます。

このプロジェクトはコミュニティ主導を目指しており、Open ASR リーダーボードと同様に、GitHub Issues および Pull Requests を通じた貢献を可能にするために、評価スクリプトをオープンソース化する予定です。

Sources