FunAudioLLM/CosyVoice
Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.
What it solves
CosyVoice는 대규모 언어 모델(LLM)을 활용한 텍스트‑투‑스피치(TTS) 시스템으로, 고품질 제로샷 다국어 음성 합성을 목표로 합니다. 특히 “인‑더‑와일드” 상황에서 자연스러운 음성을 생성하면서도 다양한 언어와 방언 간에 화자 유사도와 내용 일관성을 유지하는 문제를 해결합니다.
How it works
시스템은 LLM을 이용해 음성을 생성합니다. 최신 버전(Fun‑CosyVoice 3.0)은 스케일업과 사후 학습에 중점을 두어 운율의 자연스러움과 화자 유사도를 향상시킵니다. 제로샷 보이스 클로닝을 지원하여 짧은 샘플만으로 화자의 목소리를 모방할 수 있으며, 대규모 재학습이 필요하지 않습니다. 또한 전통적인 프런트엔드 모듈 없이도 숫자와 기호를 처리하는 텍스트 정규화 과정을 포함합니다.
Who it’s for
이 프로젝트는 확장 가능하고 고성능의 TTS 시스템이 필요한 개발자와 연구자를 위한 것으로, 다국어 및 교차 언어 합성이 필요하거나 낮은 지연 스트리밍을 요구하는 프로덕션 수준의 오디오 애플리케이션을 구축하는 경우에 적합합니다.
Highlights
- Multilingual & Dialect Support: Covers 9 common languages and over 18 Chinese dialects/accents.
- Zero-Shot Voice Cloning: Supports multi-lingual and cross-lingual voice cloning.
- Low Latency: Achieves audio-out streaming latency as low as 150ms.
- Controllability: Supports pronunciation inpainting for Pinyin and English phonemes, and instructions for emotion, speed, and volume.
- Deployment Options: Compatible with vLLM and Nvidia TensorRT-LLM for accelerated inference.