echogarden-project/echogarden

Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.

它解决了什么问题

Echogarden 提供了一个统一且易于安装的语音处理工具集。它消除了对 Python 或 Docker 等复杂系统级依赖的需求,使用户能够通过 Node.js 直接运行高质量的语音转文本、文本转语音以及音频分析工具。

它如何工作

该项目使用 TypeScript 编写,并在 Node.js 运行时上运行。它结合了纯 TypeScript 实现、WebAssembly 版本以及 ONNX 运行时,以离线方式执行 AI 模型(如 Whisper 和 Kokoro),同时提供与 Google、Microsoft、Amazon 和 OpenAI 的云端语音服务的集成。

适合谁使用

专为希望将语音功能集成到 Node.js 应用中的开发者,以及需要强大命令行界面进行音频转录、翻译和合成的终端用户设计。

主要特性

  • 全面的语音工具套件:包含文本转语音(TTS)、语音转文本(STT)、语音活动检测(VAD)和声源分离。
  • 无需 wget 的安装方式:无需 Python 或 Docker;作为标准 npm 包安装。
  • 高级对齐功能:支持使用动态时间规整(DTW)和引导解码实现语音到文本的对齐,覆盖 100 多种语言。
  • 音频增强功能:内置语音降噪和从背景音乐或环境噪音中分离人声的功能。
  • 发音优化:包含文本规范化和异音词消歧功能,以提升离线 TTS 引擎的准确性。
  • 词级时间戳:为所有识别、合成和翻译输出提供精确的时间标记。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目