Hugging Face TTS Arena:文本转语音模型基准测试

Hugging Face 推出了 TTS Arena,这是一款由社区驱动的基准测试工具,旨在评估文本转语音(TTS)模型的质量。通过在盲测的并排比较中使用人类偏好投票,该平台旨在用民主化的大规模排名系统取代不可靠的客观指标。

人本化 TTS 基准测试的必要性

诸如词错误率(WER)之类的客观指标往往无法可靠地衡量语音合成的实际质量,而传统的主观测量方法如平均意见分数(MOS)通常依赖于规模较小的实验,听众数量不足,难以有效比较质量相近的模型。

为了解决这些问题,TTS Arena 提供了一个界面,用户可以输入文本并聆听由两个不同模型生成的音频。此方法确保对自然度和语调的评估——这些对人类而言是微不足道的任务,却对 AI 来说困难——基于真实的人类感知。

TTS Arena 的工作原理

受 LMSys Chatbot Arena(用于大型语言模型)的启发,TTS Arena 采用盲测框架以最大限度降低偏见:

  • 盲目比较:模型名称在用户投票提交之前对用户隐藏。
  • 用户驱动输入:用户提供要合成的文本,从而允许各种测试案例。
  • Elo 评分系统:这些社区投票的结果被汇总到公开排行榜中。模型使用类似于国际象棋竞技中 Elo 评分系统的算法进行排名。

初始模型选择

在发布时,TTS Arena 包含了开源和专有模型的混合,以便开发者能够将开源进展与专有标准进行基准比较。初始模型集合包括:

  • ElevenLabs (proprietary)
  • MetaVoice
  • OpenVoice
  • Pheme
  • WhisperSpeech
  • XTTS

对 TTS 开发的影响

通过让模型比较和选择向公众开放,Hugging Face 旨在实现排名过程的民主化。随着社区投票的不断累积,生成的排行榜将自动更新,为语音合成的最新技术水平提供实时、不断演进的基准。

Sources