echogarden-project/echogarden
Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.
它解决了什么问题
Echogarden 提供了一个统一且易于安装的语音处理工具集。它消除了对 Python 或 Docker 等复杂系统级依赖的需求,使用户能够通过 Node.js 直接运行高质量的语音转文本、文本转语音以及音频分析工具。
它如何工作
该项目使用 TypeScript 编写,并在 Node.js 运行时上运行。它结合了纯 TypeScript 实现、WebAssembly 版本以及 ONNX 运行时,以离线方式执行 AI 模型(如 Whisper 和 Kokoro),同时提供与 Google、Microsoft、Amazon 和 OpenAI 的云端语音服务的集成。
适合谁使用
专为希望将语音功能集成到 Node.js 应用中的开发者,以及需要强大命令行界面进行音频转录、翻译和合成的终端用户设计。
主要特性
- 全面的语音工具套件:包含文本转语音(TTS)、语音转文本(STT)、语音活动检测(VAD)和声源分离。
- 无需 wget 的安装方式:无需 Python 或 Docker;作为标准 npm 包安装。
- 高级对齐功能:支持使用动态时间规整(DTW)和引导解码实现语音到文本的对齐,覆盖 100 多种语言。
- 音频增强功能:内置语音降噪和从背景音乐或环境噪音中分离人声的功能。
- 发音优化:包含文本规范化和异音词消歧功能,以提升离线 TTS 引擎的准确性。
- 词级时间戳:为所有识别、合成和翻译输出提供精确的时间标记。
相关
- 项目
- 项目
- 项目
- 项目
- 项目