Hugging Face Open TTS Leaderboard
Hugging Face 推出了 Open TTS Leaderboard,这是一个可扩展的评估框架,旨在标准化多语言文本转语音(TTS)和语音克隆模型的评估。通过用客观指标替代耗时的人工投票,该排行榜将模型评估时间从数周缩短至数小时。
客观评估指标
Open TTS Leaderboard 使用三种主要的客观指标来评估模型在不同维度上的表现:
- 可懂度:使用词错误率(WER)和字符错误率(CER)进行衡量。排行榜使用 Qwen3 ASR 对生成的音频进行转录,并与原始提示进行对比。
- 速度:通过批处理离线推理的逆实时因子(RTFx)和流式传输延迟(TTFA,批大小为 1)进行评估,测试环境为 H200 GPU 和 CPU。
- 说话人相似度:使用 WavLM 说话人嵌入之间的余弦相似度(SIM)来量化生成音频与参考音频片段之间的相似度。
多语言与语音克隆能力
该排行榜提供针对英语和多语言性能的专项排名,使用来自 Seed TTS Eval 和 CV3 Eval 的数据集。
英语性能
hexgrad/Kokoro-82M、Supertone/supertonic-3 和 fishaudio/s2-pro 等模型目前在英语 WER 方面领先。该平台包含帕累托图,用于可视化 WER、批处理推理速度(RTFx)和模型大小之间的权衡。
多语言性能
由于英语性能无法可靠地代表其他语言,排行榜允许用户切换多语言排名。k2-fsa/OmniVoice、fishaudio/s2-pro 和 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 被识别为表现强劲的多语言模型。对于基于字符的语言(中文、日文和韩文),排行榜报告 CER 而非 WER。
语音克隆
当启用“语音克隆”切换时,排行榜会比较支持零样本语音克隆的模型。一些模型,如 bosonai/higgs-tts-3-4b 和 openbmb/VoxCPM2,在提供参考音频片段时显示出更低的平均 WER。
流式传输性能与延迟
“Streaming” 选项卡专注于首次音频生成时间(TTFA),这对交互式语音代理至关重要。
- 流式模型:TTFA 指第一个音频块到达所需的时间。
- 非流式模型:TTFA 指生成完整语句所需的时间,才能开始播放。
测试在 H200 GPU 和 CPU 上对 CV3-Eval 的 50 个英语提示进行。kyutai/pocket-tts 被突出显示为在两种硬件配置下均表现出色的流式模型。
人类偏好与社区整合
尽管客观指标提供了可扩展性,Hugging Face 承认人类偏好仍是判断自然度和表现力的最终标准。为弥合这一差距,排行榜包含“Listen”选项卡,用户可比较生成结果并提供反馈。
该项目旨在社区驱动,计划开源评估脚本,允许通过 GitHub Issues 和 Pull Requests 贡献,类似于 Open ASR Leaderboard。