Edge0-AI/Audio8_TTS
SOTA-Class TTS at Compact Scale
해결하는 문제
Audio8_TTS는 높은 품질의 음성 생성과 제로샷 보이스 클론을 위한 컴팩트하고 다국어 지원 TTS 시스템입니다. 새로운 화자에 대해 추가 학습 없이 보이스 클론이 가능하면서도 매우 작은 파라미터 수(0.6B 또는 0.1B)를 유지하는 강력하면서도 이동 가능한 모델을 제공합니다.
작동 방식
이 시스템은 DualAR(Dual Autoregressive) 아키텍처를 사용합니다. "Slow AR" 트랜스포머는 각 오디오 프레임의 의미 토큰을 예측하고, "Fast AR" 트랜스포머는 느린 은닉 상태와 이전 코드북을 기반으로 코덱 코드북을 예측합니다. 모델은 자체적인 신경 코덱을 포함하여 별도의 모델 없이도 웨이브폼 복원이 가능합니다.
0.1B 버전에서는 순수 어텐션 기반의 Slow AR 백본이 Falcon-H1 하이브리드(Mamba 2 SSM + 어텐션)로 대체되어 크기를 더욱 줄이고 효율성을 높였습니다.
대상 사용자
- 애플리케이션에 통합하기 위한 가벼우면서도 이동 가능한 TTS 모델을 찾는 개발자.
- 제로샷 보이스 클론 및 효율적인 AR 아키텍처에 관심이 있는 연구자.
- 여러 언어(영어, 중국어, 일본어, 한국어, 여러 유럽 언어 포함)에서 고품질 음성 합성을 필요로 하는 uma l 사용자.
주요 특징
- 제로샷 보이스 클론: 짧은 참조 오디오 클립과 그 전사본만으로 보이스를 클론할 수 있습니다.
- 작은 크기: 0.6B 및 0.1B 파라미터 버전으로 제공되어 매우 효율적입니다.
- 다국어 지원: 광범위하게 최적화된 11개 언어(광둥어, 중국어, 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 폴란드어, 스페인어)를 지원합니다.
- 높은 성능: Seed-TTS 및 CV3와 같은 벤치마크에서 훨씬 큰 SOTA 모델과 경쟁 가능한 성능을 발휘합니다.
- 배포 옵션: CPU ONNX Runtime(INT4)를 통한 저메모리 배포와 SGLang Omni 서빙을 통한 고처리량, OpenAI 호환 API 서빙을 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트