OpenBMB/VoxCPM
VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning
解决的问题
VoxCPM 是一种无需分词器的文本到语音(TTS)系统,旨在生成高度自然、富有表现力且达到专业水准的语音。它克服了传统 TTS 中离散分词的局限性,实现了更流畅、更真实的多语言语音生成、创意语音设计以及高保真语音克隆。
工作原理
该系统基于 MiniCPM-4 骨干,采用端到端的扩散自回归架构。它直接生成连续的语音表示,而非离散的标记。最新版本 VoxCPM2 是一个 20 亿参数的模型,使用超过 200 万小时的多语言语音数据进行训练。通过 AudioVAE V2 实现非对称编码/解码设计,可从 16kHz 参考音频直接输出 48kHz 音频,并内置超分辨率功能。
适用人群
- 内容创作者:需要为视频或播客生成高质量多语言语音的用户。
- 开发者:需要实时流式传输、语音克隆或自定义语音设计的 AI 语音应用开发者。
- 企业:寻求商业可用、开源的 TTS 解决方案(Apache-2.0 许可证)的公司。
主要亮点
- 支持 30 种语言:无需语言标签即可合成 30 种不同语言及多种中文方言的语音。
- 语音设计:无需参考音频,仅通过自然语言描述(如年龄、性别、语调)即可创建新语音。
- 可控语音克隆:从短音频片段中克隆音色,同时支持风格引导以控制情感和语速。
- 极致克隆:通过使用参考音频及其转录文本,可复现所有语音细节,包括节奏和风格。
- 专业级音频输出:直接输出 48kHz 音频,并内置超分辨率功能。
- 高性能:在 NVIDIA RTX 4090 上,通过 Nano-vLLM 或 vLLM-Omni 加速,实时因子(RTF)低至 0.13,支持实时流式传输。
- 部署灵活:可通过 Python API、CLI 以及 llama.cpp-omni 等高性能 C++ 推理引擎实现设备端部署。
相关
- 项目
- 项目
- 项目
- 项目
- 项目