QwenAudio/CosyVoice
Multi-lingual large voice generation model, providing inference, training and deployment full-stack ability.
해결하는 문제
CosyVoice는 텍스트로부터 자연스럽고 일관되며 제어 가능한 음성을 생성하는 문제를 해결합니다. 특히 실제 시나리오에서 다양한 방언, 감정 및 복잡한 텍스트 형식을 처리할 수 있는 고품질 제로샷 다국어 음성 합성 요구를 타겟으로 합니다.
작동 원리
대규모 언어 모델(LLM)을 기반으로 하는 이 시스템은 지도 학습된 시맨틱 토큰을 사용하여 음성을 합성합니다. 텍스트 입력 및 오디오 출력을 지원하는 바이스트리밍(bi-streaming)을 통해 150ms만큼 낮은 저지연성을 달성합니다. 프레임워크에는 음소 발음 인페인팅, 특수 기호에 대한 텍스트 정규화, 언어, 방언, 감정, 속도 및 볼륨을 제어하기 위한 지시어 지원 기능이 포함되어 있습니다.
대상 사용자
음성 합성을 연구하는 개발자 및 연구자, 저지연성이 필요한 프로덕션 수준의 오디오 애플리케이션, 그리고 고도로 제어 가능한 다국어 보이스 클로닝이 필요한 사용자들을 위해 설계되었습니다.
주요 특징
- 다국어 및 방언 지원: 9개의 일반 언어와 18개 이상의 중국어 방언을 지원합니다.
- 제로샷 보이스 클로닝: 특정 화자에 대한 사전 학습 없이도 언어 간 및 다국어 보이스 클로닝이 가능합니다.
- 고성능: 최첨단 수준의 콘텐츠 일관성, 화자 유사성 및 운율의 자연스러움을 달성합니다.
- 저지연성: 150ms 수준의 지연 시간을 가진 스트리밍 추론을 지원합니다.
- 제어 가능성: 발음 인페인팅과 감정 및 속도에 대한 다양한 지시어 지원을 제공합니다.