samuel-vitorino/sopro

A lightweight text-to-speech model with zero-shot voice cloning

解決的問題

Sopro TTS 設計用於提供高品質、易於理解的語音合成(TTS)與語音克隆,且佔用空間極小。它解決了在消費級硬體(如筆電 CPU 或直接於瀏覽器中)上執行高效、低延遲音訊生成的需求,無需依賴龐大的 GPU 資源。

工作原理

Sopro 使用輕量級的 120M 參數模型(sopro-v2-turbo),支援從短參考音訊片段(5-20 秒)進行零樣本語音克隆。它可在兩種模式下運作:一種是用於最高音質的離線路徑,另一種是用於最小延遲的串流路徑,在筆電 CPU 上可實現約 300ms 的首段音訊輸出時間。該模型支援英語、歐洲葡萄牙語、法語和德語。

適用對象

此專案適用於需要快速、設備端 TTS 和語音克隆的開發者,以及希望透過 ONNX 執行時將語音合成整合至瀏覽器環境的開發者。

主要亮點

  • 體積小巧:120M 參數,可在筆電 CPU 和瀏覽器中運行。
  • 零樣本克隆:僅需 5-20 秒參考音訊即可克隆語音。
  • 多語言支援:支援英語、歐洲葡萄牙語、法語和德語。
  • 高效能:在 M3 CPU 和 H100 GPU 上實現低即時因子(RTF)。
  • 串流能力:支援串流音訊生成,適用於即時互動。
  • 因果聲碼器:為串流路徑內建因果聲碼器。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案