Audio8-AI/Audio8_TTS

SOTA-Class TTS at Compact Scale

해결하는 문제

Audio8_TTS는 높은 품질의 음성 생성과 제로샷 음성 클로닝을 위한 컴팩트하고 다국어 지원 음성 합성(TTS) 시스템입니다. 특정 화자의 음성을 추가 학습 없이 짧은 참조 클립만으로도 모방할 수 있도록 효율적이고 파라미터 수가 적은 모델의 필요성을 해결합니다.

작동 방식

이 시스템은 DualAR(Dual Autoregressive) 아키텍처를 사용합니다. "느린" AR 트랜스포머는 오디오 프레임의 의미 토큰을 예측하고, 이를 "빠른" AR 트랜스포머가 코덱 코드북을 예측합니다. 모델 자체에 신경망 코덱을 내장하여 별도의 모델이 필요하지 않습니다. 주로 두 가지 크기로 제공되며, 0.6B 파라미터 프리뷰 모델과 Falcon-H1 하이브리드 백본(Mamba 2 SSM + 어텐션)을 사용하는 매우 휴대 가능한 0.1B 파라미터 버전입니다.

대상 사용자

제로샷 음성 클로닝을 지원하고 ONNX Runtime을 통한 CPU 또는 SGLang Omni 서빙을 통한 고성능 GPU 서버에서 배포 가능한 경량 다국어 TTS 솔루션을 찾는 개발자 및 연구자에게 적합합니다.

주요 특징

  • 제로샷 음성 클로닝: 참조 오디오 클립과 그 전사본을 통해 음성을 모방합니다.
  • 다국어 지원: 영어, 중국어, 일본어, 한국어, 스페인어, 프랑스어, 독일어, 이탈리아어, 네덜란드어, 폴란드어 등 11개 언어에 최적화되어 있습니다.
  • 효율적인 배포: ONNX INT4를 통한 CPU 배포와 SGLang Omni(페이지화 어텐션 및 동적 배치 포함)를 통한 고처리량 서빙을 지원합니다.
  • 작은 크기: 파라미터 수가 훨씬 적지만(0.6B 대 1.5B–8.5B), Seed-TTS와 같은 여러 벤치마크에서 더 뛰어난 성능을 발휘합니다.
  • SFT 파이프라인: 추가 적응을 위한 독립된 지도형 미세조정 파이프라인을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트