echogarden-project/echogarden
Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.
What it solves
Echogarden 是一个综合性的語音處理工具集,簡化了複雜音訊 AI 任務的部署。它透過提供一個統一的 TypeScript/Node.js 環境來進行語音轉文字、文字轉語音以及音訊分析,從而消除了對 Python、Docker 或系統級依賴項的需求。
How it works
該專案使用純 TypeScript 實作、WebAssembly ports 以及 ONNX runtime 來離線執行 AI 模型。它整合了多種引擎,包括用於合成的 Kokoro 和 VITS,用於識別與翻譯的 OpenAI Whisper,以及用於音訊來源分離的 MDX-NET。它還包含一個用於模型與語音自動下載與安裝的系統。
Who it’s for
它是為想要將語音功能整合到 Node.js 應用程式中的開發者,或是偏好使用命令列介面進行音訊處理且不想管理複雜 AI 環境的使用者而設計的。
Highlights
- Multimodal Speech Tools: 支持文字轉語音 (TTS)、語音轉文字 (STT) 以及語音與逐字稿對齊。
- Audio Enhancement: 包括語音活動檢測 (VAD)、語音降噪以及音訊來源分離,以從背景噪音中分離出人聲。
- Cross-Platform: 在 Windows, macOS, 和 Linux (x64 和 ARM64) 上運行,無需 Python。
- Advanced Translation: 提供語音轉文字翻譯以及將說話音訊與翻譯後的逐字稿進行同步。
- Pronunciation Improvements: 通過對特定引擎進行文字正規化與異義詞消歧,提升 TTS 精確度。