Hugging Face Open TTS 리더보드

Hugging Face는 다국어 텍스트-음성 변환(TTS) 및 음성 클로닝 모델의 평가를 표준화하기 위해 설계된 확장 가능한 평가 프레임워크인 Open TTS 리더보드를 도입했습니다. 느린 인간 중심의 아레나 투표 대신 객관적 지표를 사용함으로써, 모델 평가에 소요되는 시간을 수주에서 몇 시간으로 단축시켰습니다.

객관적 평가 지표

Open TTS 리더보드는 모델 성능을 다양한 차원에서 평가하기 위해 세 가지 주요 객관적 지표를 사용합니다:

  • 명확성: Word Error Rate(WER)와 Character Error Rate(CER)를 사용해 측정합니다. 리더보드는 생성된 오디오를 Qwen3 ASR로 전사하여 원본 프롬프트와 비교합니다.
  • 속도: 배치된 오프라인 추론에 대해 Inverse Real-Time Factor(RTFx)로 평가하고, 스트리밍 지연(latency)에 대해 Time-to-First-Audio(TTFA)로 평가합니다(배치 크기 1). H200 GPU와 CPU에서 테스트됩니다.
  • 화자 유사성: 생성된 오디오와 참조 오디오 클립의 WavLM 화자 임베딩 간 코사인 유사도(SIM)로 측정합니다.

다국어 및 음성 클로닝 기능

리더보드는 영어 및 다국어 성능을 위한 전용 순위를 제공하며, Seed TTS Eval 및 CV3 Eval 데이터셋을 활용합니다.

영어 성능

hexgrad/Kokoro-82M, Supertone/supertonic-3, fishaudio/s2-pro와 같은 모델이 현재 영어 WER에서 선두를 달리고 있습니다. 플랫폼은 WER, 배치 추론 속도(RTFx), 모델 크기 간의 트레이드오프를 시각화하기 위해 파레토 플롯(Pareto plots)을 포함하고 있습니다.

다국어 성능

영어 성능은 다른 언어에 대한 신뢰할 수 있는 지표가 아니기 때문에, 리더보드는 다국어 순위 전환 기능을 제공합니다. k2-fsa/OmniVoice, fishaudio/s2-pro, FunAudioLLM/Fun-CosyVoice3-0.5B-2512는 강력한 다국어 모델로 식별되었습니다. 문자 기반 언어(중국어, 일본어, 한국어)의 경우, WER 대신 CER를 보고합니다.

음성 클로닝

"음성 클로닝" 토글이 활성화되면, 제로샷 음성 클로닝을 지원하는 모델들을 비교합니다. 일부 모델, 예를 들어 bosonai/higgs-tts-3-4b와 openbmb/VoxCPM2는 참조 오디오 클립이 제공될 때 평균 WER가 향상되는 것으로 나타났습니다.

스트리밍 성능 및 지연 시간

"스트리밍" 탭은 인터랙티브 음성 에이전트에 매우 중요한 Time-to-First-Audio(TTFA)에 초점을 맞춥니다.

  • 스트리밍 모델: TTFA는 첫 번째 오디오 청크가 도착하는 시간으로 측정됩니다.
  • 비스트리밍 모델: TTFA는 재생을 시작하기 전에 전체 발화를 생성하는 데 소요되는 시간입니다.

테스트는 H200 GPU와 CPU에서 CV3-Eval의 50개 영어 프롬프트를 사용하여 수행됩니다. kyutai/pocket-tts는 두 하드웨어 구성 모두에서 스트리밍 성능이 뛰어난 모델로 강조됩니다.

인간 선호도 및 커뮤니티 통합

객관적 지표는 확장성은 제공하지만, Hugging Face는 자연스러움과 표현력에 대해 인간의 선호도가 최종적인 기준임을 인정합니다. 이 격차를 메우기 위해 리더보드는 "들어보기" 탭을 포함하여 사용자가 생성된 출력을 비교하고 피드백을 제공할 수 있도록 합니다.

이 프로젝트는 커뮤니티 중심으로 운영될 예정이며, Open ASR 리더보드와 마찬가지로 평가 스크립트를 오픈소스화하여 GitHub 이슈와 풀 리퀘스트를 통해 기여를 받을 계획입니다.

Sources