echogarden-project/echogarden
Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.
What it solves
Echogarden は、複雑なオーディオ AI タスクのデプロイメントを簡素化する包括的な音声処理ツールセットです。音声認識 (STT)、テキスト読み上げ (TTS)、および音声解析のための統一された TypeScript/Node.js 環境を提供することで、 Python や Docker、システムレベルの依存関係を排除します。
How it works
このプロジェクトは、純粋な TypeScript 実装、WebAssembly ports、および ONNX runtime を組み合わせて、AI モデルをオフラインで実行します。合成には Kokoro や VITS、認識と翻訳には OpenAI Whisper、音源分離には MDX-NET を含む、幅広いエンジンの統合を実現しています。また、モデルや音声の自動ダウンロードとインストールシステムも備えています。
Who it’s for
Node.js アプリケーションに音声機能を集約・統合したい開発者や、複雑な AI 環境を管理せずにコマンドラインインターフェースを使用して音声処理を行いたいユーザー向けに設計されています。
Highlights
Multimodal Speech Tools: テキスト読み上げ (TTS)、音声認識 (STT)、および音声と書き起こしのアライメントをサポートします。
Audio Enhancement: 音声活動検知 (VAD)、音声ノイズ除去、および音源分離により、背景ノイズから声を取り出します。
Cross-Platform: Windows, macOS, および Linux (x64 および ARM64) 上で、 Python を必要とせず動作します。
Advanced Translation: 音声からテキストへの翻訳機能、および音声と翻訳後の書き起こしテキストの同期を提供します。
Pronunciation Improvements: 特定のエンジンにおいて、テキスト正規化や同音異義語の判別により、 TTS の精度を向上させます。