supertone-inc/supertonic
Lightning-Fast, On-Device, Multilingual TTS — running natively via ONNX.
해결하는 문제
Supertonic은 클라우드 API의 필요성을 없애 지연 시간을 줄이고 개인정보 보호를 개선하는 고성능 온디바이스 텍스트 음성 변환(TTS) 시스템입니다. 대규모 TTS 모델의 경량화된 대안을 제공하여 모바일 기기, 브라우저, Raspberry Pi와 같이 리소스가 제한된 하드웨어에서 스튜디오급 오디오 합성을 로컬에서 실행할 수 있도록 합니다.
작동 원리
ONNX Runtime를 기반으로 하는 Supertonic은 99M 파라미터의 컴팩트한 오픈 웨이트 모델을 사용하여 완전히 기기 내에서 추론을 수행합니다. 31개 언어를 지원하며, 입력 언어를 알 수 없는 경우 언어에 구애받지 않는 모드(lang="na")로 작동할 수 있습니다. 시스템은 44.1kHz 16-bit WAV 오디오를 출력하며, 복잡한 프롬프트 엔지니어링 없이도 음성에 인간적인 뉘앙스를 더할 수 있는 표현 태그(예: <laugh>, <breath>)를 포함합니다.
대상 사용자
GPU나 네트워크 연결에 의존하지 않고 빠르고 프라이빗하며 고품질의 음성 합성이 필요한 브라우저 확장 프로그램, 전자책 리더, 에지 디바이스 소프트웨어와 같은 로컬 우선 애플리케이션을 구축하는 개발자.
주요 특징
- 에지 최적화: 데스크톱, 모바일, 브라우저(WebGPU/WASM 경유) 및 Raspberry Pi에서 로컬로 실행.
- 다국어 지원: 31개 언어를 지원하며 선택적으로 언어에 구애받지 않는 처리 모드 제공.
- 컴팩트한 모델: 99M 파라미터 크기로 일반적인 0.7B-2B 클래스 TTS 시스템보다 훨씬 작음.
- 폭넓은 SDK 지원: Python, Node.js, Java, C++, C#, Go, Swift, iOS, Rust, Flutter용 즉시 사용 가능한 예제 제공.
- 자연스러운 텍스트 처리: 금융 용어, 전화번호, 기술 단위 등을 정확하게 읽는 데 특화.
- 표현 태그: 한숨이나 웃음과 같은 비언어적 소리를 위한 내장 태그로 현실감 향상.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트