OpenBMB/VoxCPM
VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning
解決的問題
VoxCPM 是一種無需分詞器的語音合成(TTS)系統,旨在生成高度自然、富有表現力且達到專業水準的語音。它克服了傳統 TTS 中離散分詞的限制,實現更流暢、更真實的多語音語音生成、創意語音設計以及高保真語音克隆。
工作原理
該系統基於 MiniCPM-4 骨幹,採用端到端的擴散自回歸架構。它直接生成連續的語音表示,而非離散的標記。最新版本 VoxCPM2 是一個 20 億參數的模型,使用超過 200 萬小時的多語音語音資料進行訓練。透過 AudioVAE V2 實現非對稱編碼/解碼設計,可從 16kHz 參考語音直接輸出 48kHz 語音,並內建超解析度功能。
適用對象
- 內容創作者:需要為影片或播客生成高品質多語音語音的使用者。
- 開發者:需要即時串流、語音克隆或自訂語音設計的 AI 語音應用開發者。
- 企業:尋求商業可用、開源的 TTS 解決方案(Apache-2.0 許可證)的公司。
主要亮點
- 支援 30 種語言:無需語言標籤即可合成 30 種不同語言及多種中文方言的語音。
- 語音設計:無需參考語音,僅透過自然語言描述(如年齡、性別、語調)即可創建新語音。
- 可控語音克隆:從短語音片段中克隆音色,同時支援風格引導以控制情感和語速。
- 極致克隆:透過使用參考語音及其轉錄文本,可重現所有語音細節,包括節奏和風格。
- 專業級音訊輸出:直接輸出 48kHz 音訊,並內建超解析度功能。
- 高效率:在 NVIDIA RTX 4090 上,透過 Nano-vLLM 或 vLLM-Omni 加速,即時因子(RTF)低至 0.13,支援即時串流傳輸。
- 部署彈性:可透過 Python API、CLI 以及 llama.cpp-omni 等高效率 C++ 推論引擎實現裝置端部署。
相關
- 專案
- 專案
- 專案
- 專案
- 專案