Zyphra/ZONOS2

Zonos2 is a leading open-weight text-to-speech MoE.

해결하는 문제

ZONOS2는 낮은 지연 시간으로 자연스러운 음성 클로닝과 표현력 있는 음성 합성을 제공하는 고해상도 음성 합성(TTS) 시스템입니다. 화자 정체성을 유지하면서도 감정, 속도, 품질을 정밀하게 제어할 수 있는 인간과 유사한 음성을 생성하는 문제를 해결합니다.

작동 방식

ZONOS2는 Mixture-of-Experts(MoE) 백본을 사용하여 DAC 토큰을 생성합니다. 추론 시에는 정규화된 UTF-8 바이트와 ECAPA-TDNN 화자 임베딩을 처리하여 음성을 합성합니다. 이 시스템은 세 가지 수준의 언어 지원을 제공하며, Mini-SGLang 기반 고성능 추론 서버와 CPU 및 크로스플랫폼 사용을 위한 ggml 구현을 포함한 다양한 모델 실행 방법을 제공합니다.

대상 사용자

고품질의 다국어 TTS가 필요하고, 고도의 음성 클로닝 기능 및 실시간 애플리케이션에서 감정 프로소디를 미세 조정할 수 있는 개발자 및 연구자에게 적합합니다.

주요 특징

  • 거대한 학습 데이터셋: 600만 시간 이상의 다양한 다국어 음성 데이터로 훈련됨.
  • 고도의 음성 클로닝: 참조 음성 파일로부터 고해상도 클로닝 가능.
  • 감정 제어: 화자 정체성을 변경하지 않고도 특정 감정(기쁨, 슬픔, 분노, 놀람)이나 감정의 가치/각성 축을 따라 방향 벡터를 추가하여 음성의 감정을 조정 가능.
  • 광범위한 언어 지원: 영어, 중국어(간체), 일본어 등 수십 개 언어를 세 가지 수준의 지원으로 제공.
  • 유연한 배포 옵션: 오프라인 추론용 Python API, 웹 UI를 갖춘 전용 TTS 서버, OpenAI 호환 API 엔드포인트를 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트