OpenBMB/VoxCPM

VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning

解決的問題

VoxCPM 是一種無需分詞器的語音合成(TTS)系統,旨在生成高度自然、富有表現力且達到專業水準的語音。它克服了傳統 TTS 中離散分詞的限制,實現更流暢、更真實的多語音語音生成、創意語音設計以及高保真語音克隆。

工作原理

該系統基於 MiniCPM-4 骨幹,採用端到端的擴散自回歸架構。它直接生成連續的語音表示,而非離散的標記。最新版本 VoxCPM2 是一個 20 億參數的模型,使用超過 200 萬小時的多語音語音資料進行訓練。透過 AudioVAE V2 實現非對稱編碼/解碼設計,可從 16kHz 參考語音直接輸出 48kHz 語音,並內建超解析度功能。

適用對象

  • 內容創作者:需要為影片或播客生成高品質多語音語音的使用者。
  • 開發者:需要即時串流、語音克隆或自訂語音設計的 AI 語音應用開發者。
  • 企業:尋求商業可用、開源的 TTS 解決方案(Apache-2.0 許可證)的公司。

主要亮點

  • 支援 30 種語言:無需語言標籤即可合成 30 種不同語言及多種中文方言的語音。
  • 語音設計:無需參考語音,僅透過自然語言描述(如年齡、性別、語調)即可創建新語音。
  • 可控語音克隆:從短語音片段中克隆音色,同時支援風格引導以控制情感和語速。
  • 極致克隆:透過使用參考語音及其轉錄文本,可重現所有語音細節,包括節奏和風格。
  • 專業級音訊輸出:直接輸出 48kHz 音訊,並內建超解析度功能。
  • 高效率:在 NVIDIA RTX 4090 上,透過 Nano-vLLM 或 vLLM-Omni 加速,即時因子(RTF)低至 0.13,支援即時串流傳輸。
  • 部署彈性:可透過 Python API、CLI 以及 llama.cpp-omni 等高效率 C++ 推論引擎實現裝置端部署。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案