OpenBMB/VoxCPM
VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning
해결하는 문제
VoxCPM은 전통적인 TTS에서의 이산 토큰화의 한계를 극복하여 매우 자연스럽고 표현력이 풍부한 스튜디오 수준의 음성 생성을 위한 토큰화가 없는 음성 합성 시스템입니다. 다국어 음성 생성, 창의적인 음성 디자인, 고해상도 음성 클론 생성을 가능하게 합니다.
작동 방식
이 시스템은 MiniCPM-4를 기반으로 한 엔드투엔드 확산 자기회귀 아키텍처를 사용합니다. 이는 이산 토큰이 아닌 연속적인 음성 표현을 직접 생성합니다. 최신 버전인 VoxCPM2는 200만 시간 이상의 다국어 음성 데이터로 훈련된 20억 파라미터 모델입니다. AudioVAE V2를 활용한 비대칭 인코딩/디코딩 설계를 통해 16kHz 참조 음성에서 직접 48kHz 음성을 출력하며 내장된 슈퍼리졸루션 기능을 포함합니다.
대상 사용자
- 콘텐츠 제작자: 영상이나 팟캐스트용 고품질 다국어 음성 합성을 필요로 하는 분들.
- 개발자: 실시간 스트리밍, 음성 클론, 맞춤형 음성 디자인을 필요로 하는 AI 음성 애플리케이션을 개발하는 분들.
- 기업: 상용 사용 가능한 오픈소스 TTS 솔루션을 찾는 기업 (Apache-2.0 라이선스).
주요 특징
- 30개 언어 지원: 언어 태그 없이 30개 이상의 언어 및 다양한 중국어 방언의 음성 합성 가능.
- 음성 디자인: 참조 음성 없이 자연어 설명(예: 나이, 성별, 톤)을 기반으로 새로운 음성 생성.
- 제어 가능한 음성 클론: 짧은 클립에서 톤을 클론하면서 감정과 속도에 대한 스타일 가이드 가능.
- 최고 수준의 클론: 참조 음성과 그 전사본을 사용하여 리듬과 스타일을 포함한 모든 음성의 미묘한 특징 재현.
- 스튜디오 수준의 오디오: 내장된 슈퍼리졸루션을 통해 직접 48kHz 오디오 출력.
- 고성능: Nano-vLLM 또는 vLLM-Omni로 가속 시 NVIDIA RTX 4090에서 RTF가 0.13까지 낮아져 실시간 스트리밍 지원.
- 배포 유연성: Python API, CLI, 그리고 llama.cpp-omni와 같은 고성능 C++ 추론 엔진을 통해 디바이스 내 사용도 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트