Hugging Face Open TTS 排行榜

Hugging Face 推出了 Open TTS 排行榜,這是一個可擴展的評估框架,旨在標準化多語言語音合成(TTS)和語音克隆模型的評估。透過以客觀指標取代耗時的人工評選,排行榜將模型評估時間從數週縮短至數小時。

客觀評估指標

Open TTS 排行榜使用三個主要的客觀指標來評估模型在不同維度上的表現:

  • 可理解性:使用詞錯誤率(WER)和字元錯誤率(CER)進行衡量。排行榜使用 Qwen3 ASR 對生成的音訊進行轉錄,並與原始提示進行比較。
  • 速度:透過逆向實時因子(RTFx)評估批量離線推理速度,並以首段音訊時間(TTFA)評估串流延遲(批量大小為 1),測試環境為 H200 GPU 和 CPU。
  • 說話者相似度:使用 WavLM 語音嵌入之間的餘弦相似度(SIM)來量化生成音訊與參考音訊片段的相似程度。

多語言與語音克隆能力

排行榜提供針對英文與多語言表現的專門排名,使用來自 Seed TTS Eval 和 CV3 Eval 的資料集。

英文表現

目前 hexgrad/Kokoro-82M、Supertone/supertonic-3 和 fishaudio/s2-pro 在英文 WER 表現上領先。平台包含帕累托圖,用以視覺化 WER、批量推理速度(RTFx)與模型大小之間的權衡。

多語言表現

由於英文表現無法可靠地代表其他語言,排行榜允許使用者切換多語言排名。k2-fsa/OmniVoice、fishaudio/s2-pro 和 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 被識別為強大的多語言模型。針對表意文字語言(中文、日文與韓文),排行榜報告 CER 而非 WER。

語音克隆

當啟用「語音克隆」切換時,排行榜會比較支援零樣本語音克隆的模型。部分模型如 bosonai/higgs-tts-3-4b 和 openbmb/VoxCPM2 在提供參考音訊片段時,平均 WER 表現有所提升。

串流性能與延遲

「串流」標籤頁專注於首段音訊時間(TTFA),這對互動式語音代理至關重要。

  • 串流模型:TTFA 為第一段音訊片段到達的時間。
  • 非串流模型:TTFA 為生成完整語句所需時間,才能開始播放。

測試在 H200 GPU 和 CPU 上執行,使用 CV3-Eval 的 50 個英文提示。kyutai/pocket-tts 被突出為在兩種硬體配置下均表現優異的串流模型。

人類偏好與社群整合

雖然客觀指標提供可擴展性,但 Hugging Face 承認人類偏好仍是自然度與表現力的最終決定因素。為彌補此差距,排行榜包含「聆聽」標籤頁,讓使用者比較生成輸出並提供反饋。

該專案旨在社群驅動,計畫將評估腳本開源,允許透過 GitHub Issues 和 Pull Requests 進行貢獻,類似 Open ASR 排行榜的做法。

Sources