samuel-vitorino/sopro
A lightweight text-to-speech model with zero-shot voice cloning
解決的問題
Sopro TTS 設計用於提供高品質、易於理解的語音合成(TTS)與語音克隆,且佔用空間極小。它解決了在消費級硬體(如筆電 CPU 或直接於瀏覽器中)上執行高效、低延遲音訊生成的需求,無需依賴龐大的 GPU 資源。
工作原理
Sopro 使用輕量級的 120M 參數模型(sopro-v2-turbo),支援從短參考音訊片段(5-20 秒)進行零樣本語音克隆。它可在兩種模式下運作:一種是用於最高音質的離線路徑,另一種是用於最小延遲的串流路徑,在筆電 CPU 上可實現約 300ms 的首段音訊輸出時間。該模型支援英語、歐洲葡萄牙語、法語和德語。
適用對象
此專案適用於需要快速、設備端 TTS 和語音克隆的開發者,以及希望透過 ONNX 執行時將語音合成整合至瀏覽器環境的開發者。
主要亮點
- 體積小巧:120M 參數,可在筆電 CPU 和瀏覽器中運行。
- 零樣本克隆:僅需 5-20 秒參考音訊即可克隆語音。
- 多語言支援:支援英語、歐洲葡萄牙語、法語和德語。
- 高效能:在 M3 CPU 和 H100 GPU 上實現低即時因子(RTF)。
- 串流能力:支援串流音訊生成,適用於即時互動。
- 因果聲碼器:為串流路徑內建因果聲碼器。
相關
- 專案
- 專案
- 專案
- 專案
- 專案