echogarden-project/echogarden

Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.

What it solves

Echogarden 是一个综合性的语音处理工具集,简化了复杂音频 AI 任务的部署。它通过提供一个统一的 TypeScript/Node.js 环境来处理语音转文本、文本转语音以及音频分析,从而消除了对 Python、Docker 或系统级依赖项的需求。

How it works

该项目使用纯 TypeScript 实现、WebAssembly ports 以及 ONNX runtime 来离线运行 AI 模型。它集成了多种引擎,包括用于合成的 Kokoro 和 VITS,用于识别与翻译的 OpenAI Whisper,,用于音频源分离的 MDX-NET。它还包含一个用于模型和语音的自动下载与安装系统。

Who it’s for

它是为想要将语音功能集成到 Node.js 应用中或更喜欢使用命令行界面进行音频处理且不想管理复杂 AI 环境的用户设计的。

Highlights

  • Multimodal Speech Tools: 支持文本转语音 (TTS)、语音转文本 (STT) 以及语音与逐字稿对齐。
  • Audio Enhancement: 包括语音活动检测 (VAD)、语音降噪以及音频源分离,以从背景噪声中分离出人声。
  • Cross-Platform: 在 Windows, macOS, 和 Linux (x64 和 ARM64) 上运行,无需 Python。
  • Advanced Translation: 提供语音转文本翻译以及将说话音频与翻译后的文本进行同步。
  • Pronunciation Improvements: 通过对特定引擎进行文本归一化和多音字消歧,多音字消歧,提升 TTS 精确度。