Hugging Face TTS Arena: テキスト音声合成モデルのベンチマーク

Hugging Faceは、テキスト音声合成(TTS)モデルの品質を評価することを目的とした、コミュニティ主導のベンチマークツールであるTTS Arenaを導入しました。ブラインドな並列比較で人間の好み投票を活用することで、信頼性の低い客観的指標に代わり、民主的で大規模なランキングシステムを提供することを目指しています。

人間中心のTTSベンチマークの必要性

Word Error Rate(WER)などの客観的指標は、音声合成の実際の品質を測定する際に信頼性が低いことが多く、従来の主観的指標であるMean Opinion Score(MOS)も、リスナーが少数である小規模実験に依存しており、同等の品質を持つモデルを効果的に比較することが難しいです。

これらの課題に対処するため、TTS Arenaはユーザーがテキストを入力し、2つの異なるモデルが生成した音声を聴くことができるインターフェースを提供します。このアプローチにより、自然さや抑揚の評価(人間にとっては容易でもAIにとっては困難なタスク)が実際の人間の知覚に基づくものとなります。

TTS Arenaの仕組み

大規模言語モデル向けのLMSys Chatbot Arenaに触発され、TTS Arenaはバイアスを最小化するためにブラインドテストフレームワークを採用しています。

  • Blind Comparison: 投票が提出されるまで、モデル名はユーザーに隠されます。
  • User-Driven Input: ユーザーが合成するテキストを提供し、さまざまなテストケースに対応できます。
  • Elo Rating System: これらのコミュニティ投票の結果は公開リーダーボードに集計されます。モデルは、競技チェスで使用されるEloレーティングシステムに類似したアルゴリズムで順位付けされます。

初期モデルの選択

開始時に、TTS Arenaはオープンソースとプロプライエタリの両方のモデルを組み合わせて提供し、開発者がオープンソースの進捗をプロプライエタリ標準と比較できるようにしています。初期のモデルセットは以下の通りです:

  • ElevenLabs (proprietary)
  • MetaVoice
  • OpenVoice
  • Pheme
  • WhisperSpeech
  • XTTS

TTS開発への影響

モデルの比較と選択を一般に公開することで、Hugging Faceはランキングプロセスの民主化を目指しています。リーダーボードは、コミュニティ投票が増えるにつれて自動的に更新され、音声合成の最先端をリアルタイムで進化させるベンチマークを提供します。

Sources