echogarden-project/echogarden

Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.

무엇을 해결하는가

Echogarden은 음성 처리를 위한 통합되고 설치가 간편한 도구 모음을 제공합니다. Python이나 Docker와 같은 복잡한 시스템 수준의 종속성을 제거하여, 사용자가 Node.js를 통해 고품질의 speech-to-text, text-to-speech, 및 audio analysis 도구를 직접 실행할 수 있도록 합니다.

작동 방식

이 프로젝트는 TypeScript로 작성되었으며 Node.js 런타임에서 실행됩니다. 순수 TypeScript 구현, WebAssembly 포트, 그리고 ONNX 런타임을 결합하여 AI 모델(Whisper 및 Kokoro 등)을 오프라인으로 실행하는 동시에, Google, Microsoft, Amazon, OpenAI의 클라우드 기반 음성 서비스와의 통합도 제공합니다.

대상 사용자

Node.js 애플리케이션에 음성 기능을 통합하려는 개발자 또는 오디오 전사, 번역, 및 합성을 위한 강력한 명령줄 인터페이스가 필요한 최종 사용자들을 위해 설계되었습니다.

주요 특징

  • 포괄적인 음성 스위트: text-to-speech (TTS), speech-to-text (STT), voice activity detection (VAD), 및 source separation을 포함합니다.
  • wget-free 설치: Python이나 Docker가 필요하지 않으며, 표준 npm 패키지로 설치됩니다.
  • 고급 정렬: dynamic time warping (DTW) 및 guided decoding을 사용하여 100개 이상의 언어에 대해 speech-to-transcript 정렬을 지원합니다.
  • 오디오 향상: 내장된 음성 노이즈 제거 및 배경 음악이나 주변 소음으로부터의 음성 격리 기능을 제공합니다.
  • 발음 개선: 오프라인 TTS 엔진의 정확도를 높이기 위해 텍스트 정규화 및 heteronym disambiguation을 포함합니다.
  • 단어 수준 타임스탬프: 모든 인식, 합성, 및 번역 출력에 대해 정밀한 타이밍 정보를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트