echogarden-project/echogarden

Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.

What it solves

Echogarden은 복잡한한 오디오 AI 작업의 배포를 단순화하는 종합적인 음성 처리 툴셋입니다. 음성 인식(STT), 텍스트 음성 변환(TTS), 오디오 분석을 위한 통합된 TypeScript/Node.js 환경을 제공하여 Python, Docker, 또는 시스템 수준의 의존성을 제거합니다.

How it works

이 프로젝트는 순수 TypeScript 구현, WebAssembly ports, 그리고 ONNX runtime을 사용하여 AI 모델을 오프라인으로 실행합니다. Kokoro와 VITS를 통한 합성, OpenAI Whisper를 통한 인식 및 번역, MDX-NET을 통한 음원 분리를 포함한 다양한 엔진을 통합합니다. 또한 모델과 음성을 자동으로 다운로드하고 설치하는 시스템도 포함되어 있습니다.

Who it’s for

Node.js 애플리케이션에 음성 기능을 통합하고자 하는 개발자나, 복잡한 AI 환경을 관리하지 않고 명령줄 인터페이스(CLI)를 통해 오디오 처리를 선호하는 사용자를 위해 설계되었습니다.

How it works

Highlights

  • Multimodal Speech Tools: 텍스트 음성 변환(TTS), 음성 인식(STT), 및 음성-텍스트 정렬 기능을 지원합니다.

  • Audio Enhancement: 음성 활동 감지(VAD), 음성 노이즈 제거, 및 배경 소음으로부터 목소리를 분리하는 음원 분리 기능을 포함합니다.

  • Cross-Platform: Python 없이 Windows, macOS, Linux (x64 및 ARM64)에서 실행됩니다.

  • Advanced Translation: 음성-텍스트 번역 및 말하는 오디오와 번역된 텍스트 사이의 싱크를 맞추는 동기화 기능을 제공합니다।

  • Pronunciation Improvements: 특정 엔진에 대해 텍스트 정규화 및 동음의어 중의성 해소를 통해 TTS 정확도를 향상시킵니다.