echogarden-project/echogarden
Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.
解決的問題
Echogarden 提供了一套統一且易於安裝的語音處理工具集。它消除了對複雜系統級依賴(如 Python 或 Docker)的需求,讓使用者能直接透過 Node.js 執行高品質的語音轉文字、文字轉語音以及音訊分析工具。
如何運作
此專案以 TypeScript 寫成,並在 Node.js 執行環境中運行。它結合純 TypeScript 實作、WebAssembly 版本以及 ONNX 執行時,離線執行 AI 模型(如 Whisper 和 Kokoro),同時也提供與 Google、Microsoft、Amazon 和 OpenAI 的雲端語音服務整合。
適用對象
專為希望將語音功能整合至 Node.js 應用程式的開發者,或需要強大命令列介面進行音訊轉錄、翻譯與合成的終端使用者設計。
主要特色
- 完整的語音工具套件:包含文字轉語音(TTS)、語音轉文字(STT)、語音活動檢測(VAD)以及音源分離。
- 免 wget 安裝:無需 Python 或 Docker;可作為標準 npm 套件安裝。
- 進階對齊功能:支援使用動態時間扭曲(DTW)與引導解碼的語音轉文字對齊,支援超過 100 種語言。
- 音訊增強:內建語音降噪與從背景音樂或環境音中分離語音的功能。
- 發音改善:包含文字正規化與異音字歧義消除,以提升離線 TTS 引擎的準確性。
- 詞級時間戳記:為所有辨識、合成與翻譯輸出提供精確的時間資訊。
相關
- 專案
- 專案
- 專案
- 專案
- 專案