Ampixa/sanoTTS
sanoTTS (सानो = 'small' in Nepali): a ~1.4M-param neural TTS that runs on a $3 chip or in the browser. Leads SCOREQ/UTMOS in the sub-15M class.
해결하는 문제
sanoTTS는 클라우드 연결, 전용 신경처리장치(NPU), 서버 없이도 저전력 하드웨어에서 로컬로 실행 가능한 매우 작은 신경망 음성합성(TTS) 음성 패밀리를 제공합니다. 이는 $3짜리 ESP32-S3 마이크로컨트롤러에서 또는 WebAssembly(WASM)을 통해 브라우저 내에서 실시간 음성 합성을 가능하게 합니다.
작동 방식
이 시스템은 다단계 파이프라인을 사용합니다: espeak-ng 포네파이저가 텍스트를 포네프 아이디로 변환하고, 지속 시간 모델이 시간을 예측하며, 음향 모델이 생성기 잠재변수를 예측하고, 디코더가 최종 오디오를 렌더링합니다. 타겟 플랫폼에 따라 다른 디코더를 사용합니다: 브라우저용으로는 컴팩트한 시간 영역 디코더(fp32 WASM), 마이크로컨트롤러용으로는 양자화된 int8 iSTFT 디코더를 사용하여 실시간 성능을 보장합니다.
대상 사용자
- 임베디드 개발자: 저렴한 마이크로컨트롤러에서 음성 기능을 갖춘 장치를 개발하고 싶은 분들.
- 웹 개발자: 웹사이트에 클라이언트 사이드, 서버리스 TTS를 추가하고 싶은 분들.
- 파이썬 개발자: 가볍고 종속성 없는 TTS 라이브러리를 찾는 분들.
주요 특징
- 초소형 크기: 모델 크기는 294k에서 2.3M 파라미터까지 다양하며, 가장 작은 모델(heart-nano)은 단 337KB에 불과합니다.
- 다양한 언어 지원: 영어, 스페인어, 프랑스어, 아랍어, 네팔어를 포함한 16개 언어에 총 30개의 음성 지원.
- 고효율성: ESP32-S3에서 실시간 요소(RTF) 0.383을 달성하여 실시간보다 2.6배 빠르게 음성 합성 가능.
- 의존성 없음: 파이썬 패키지는 추론에 순수 numpy만 사용하며, 브라우저 버전은 완전히 클라이언트 사이드에서 동작합니다.
- 사용자 정의 가능: 사용자가 자신의 음성을 생성하고 정제할 수 있는 완전한 학습 레시피 포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트