pnnbao97/VieNeu-TTS
Vietnamese TTS with instant voice cloning • On-device • Real-time CPU inference • 24kHz audio quality • Chuyển văn bản thành giọng nói tiếng Việt • Text to speech tiếng Việt • TTS tiếng Việt
解決的問題
VieNeu-TTS 提供專為越南語優化之高保真、自然流暢的語音合成(TTS)系統,支援英越雙語混用(程式碼切換)。解決在不需大量運算資源的情況下,實現本地化、低延遲語音合成的需求,能處理多語者對話與即時語音克隆。
工作原理
本專案提供多種模型架構(v1、v2 和 v3 Turbo)。最新 v3 Turbo 版本採用從零開始設計的架構,支援 48 kHz 高保真音訊輸出與專用音素化器。支援不同後端:無需 torch 的 ONNX Runtime,適用於快速 CPU 推論與串流傳輸;以及適用於 GPU 高吞吐量批次生成的 PyTorch 引擎。此外,還包含一個降噪流程,用於清理語音克隆用的參考音訊片段。
適用對象
- 開發者:正在建構互動式越南語 AI 應用或即時語音助理的開發者。
- 內容創作者:需要為播客或對話場景生成自然越南語配音的內容創作者。
- 邊緣裝置工程師:尋找輕量級、離線運行、在 CPU 或 Apple Silicon 上高效運作的 TTS 解決方案的工程師。
主要亮點
- 雙語支援:越南語與英語之間無縫切換。
- 即時語音克隆:僅需 3–8 秒音訊片段即可克隆語音。
- 高保真度:v3 Turbo 支援 48 kHz 音訊,實驗性支援情感提示(如笑聲、嘆氣)。
- 彈性部署:提供 Python SDK、Web UI 或高效能 Docker 化 API 伺服器。
- 性能優化:支援幀級串流傳輸以實現即時互動,也支援批次生成以處理大規模合成。
相關
- 專案
- 專案
- 專案
- 專案
- 專案