samuel-vitorino/sopro
A lightweight text-to-speech model with zero-shot voice cloning
해결하는 문제
Sopro TTS는 매우 작은 크기로 고품질이고 이해하기 쉬운 텍스트-to-음성(TTS) 및 보이스 클론을 제공하도록 설계되었습니다. 이는 대규모 GPU 리소스 없이도 소비자용 하드웨어(예: 랩톱 CPU 또는 웹 브라우저 내부)에서 효율적이고 낮은 지연 시간의 오디오 생성이 가능하도록 하는 필요성을 충족합니다.
작동 방식
Sopro는 120M 파라미터의 가벼운 모델(sopro-v2-turbo)을 사용하며, 짧은 참조 오디오 클립(5~20초)에서 제로샷 보이스 클론을 지원합니다. 오프라인 경로(최고 품질)와 스트리밍 경로(최소 지연) 두 가지 모드로 작동할 수 있으며, 랩톱 CPU에서 최초 오디오 출력까지의 시간은 약 300ms입니다. 모델은 영어, 유럽 포르투갈어, 프랑스어, 독일어를 지원합니다.
대상 사용자
이 프로젝트는 빠르고 디바이스 내 TTS 및 보이스 클론이 필요한 개발자, 그리고 ONNX 런타임을 통해 브라우저 기반 환경에 음성 합성을 통합하고자 하는 개발자에게 적합합니다.
주요 특징
- 작은 크기: 120M 파라미터로 랩톱 CPU와 브라우저에서 실행 가능.
- 제로샷 클론: 5~20초의 참조 오디오로 보이스 클론 가능.
- 다국어 지원: 영어, 유럽 포르투갈어, 프랑스어, 독일어 지원.
- 고효율성: M3 CPU 및 H100 GPU에서 낮은 실시간 요인(RTF) 제공.
- 스트리밍 기능: 실시간 상호작용에 적합한 스트리밍 오디오 생성 지원.
- 인과적 보코더: 스트리밍 경로용 인과적 보코더 포함.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트