Hugging Face TTS Arena:文本轉語音模型基準測試

Hugging Face 推出了 TTS Arena,一個由社群驅動的基準測試工具,旨在評估文本轉語音(TTS)模型的品質。透過在盲測的並排比較中使用人類偏好投票,平台旨在以民主化的大規模排名系統取代不可靠的客觀指標。

以人為本的 TTS 基準測試需求

像是字詞錯誤率(WER)等客觀指標往往無法可靠地衡量語音合成的實際品質,而傳統的主觀測量方式如平均意見分數(MOS)通常依賴規模較小的實驗,聽眾數量過少,難以有效比較品質相近的模型。

為了解決這些問題,TTS Arena 提供了一個介面,讓使用者輸入文字並聆聽由兩個不同模型產生的音訊。此方式確保對自然度與語調的評估——對人類而言是微不足道、但對 AI 卻相當困難的任務——以實際的人類感知為基礎。

TTS Arena 的運作方式

受 LMSys Chatbot Arena(大型語言模型)啟發,TTS Arena 採用盲測框架以降低偏見:

  • Blind Comparison:模型名稱在使用者投票提交前會被隱藏。
  • User-Driven Input:使用者提供要合成的文字,允許各式各樣的測試案例。
  • Elo Rating System:這些社群投票的結果會彙總至公開排行榜。模型的排名使用類似於競技棋賽中 Elo 評分系統的演算法。

初始模型選擇

在首次上線時,TTS Arena 包含了開源與專有模型的混合,以讓開發者能將開源的進展與專有標準進行基準測試。初始模型包括:

  • ElevenLabs(專有)
  • MetaVoice
  • OpenVoice
  • Pheme
  • WhisperSpeech
  • XTTS

對 TTS 發展的影響

透過讓模型比較與選擇向大眾開放,Hugging Face 旨在使排名過程民主化。隨著社群投票持續累積,產生的排行榜將自動更新,提供即時且不斷演進的基準,以衡量語音合成領域的最新技術水平。

Sources