CosyVoice: 제로샷 다국어 음성 합성을 위한 고급 LLM 기반 텍스트-음성 시스템
CosyVoice: 제로샷 다국어 음성 합성을 위한 고급 LLM 기반 텍스트-음성 시스템
What it solves
CosyVoice는 텍스트로부터 자연스럽고 일관되며 제어 가능한 음성을 생성하는 과제를 해결합니다. 구체적으로는 다양한 방언, 감정, 복잡한 텍스트 형식을 실제 시나리오에서 처리할 수 있는 고품질 제로샷 다국어 음성 합성의 필요성을 대상으로 합니다.
How it works
대규모 언어 모델(LLM)을 기반으로, 시스템은 음성을 합성하기 위해 감독된 의미 토큰을 사용합니다. 텍스트 입력과 음성 출력의 바이 스트리밍(텍스트 입력과 음성 출력)을 지원하여 150ms 이하의 낮은 지연 시간을 달성합니다. 프레임워크에는 음소에 대한 발음 인페인팅, 특수 기호에 대한 텍스트 정규화, 언어, 방언, 감정, 속도, 볼륨을 제어하기 위한 명령 지원과 같은 기능이 포함됩니다.
Who it’s for
음성 합성을 작업하는 개발자와 연구자, 낮은 지연 시간을 요구하는 프로덕션 수준 오디오 애플리케이션, 그리고 높이 제어 가능한 다국어 음성 복제가 필요한 사용자를 위해 설계되었습니다.
Highlights
- 다국어 및 방언 지원: 9가지 일반적인 언어와 18가지 이상의 중국 방언을 지원합니다.
- 제로샷 음성 복제: 특정 화자에 대한 사전 훈련 없이 교차 언어 및 다중 언어 음성 복제를 가능하게 합니다.
- 고성능: 최첨단 콘텐츠 일관성, 화자 유사성, 운율 자연스러움을 달성합니다.
- 낮은 지연 시간: 150ms 이하의 지연 시간을 가진 스트리밍 추론을 지원합니다.
- 제어 가능성: 발음 인페인팅과 감정 및 속도를 위한 다양한 명령을 지원합니다.