echogarden-project/echogarden

Cross-platform speech toolset, used from the command-line or as a Node.js library. Includes a variety of engines for speech synthesis, speech recognition, forced alignment, speech translation, voice isolation, language detection and more.

何を解決するか

Echogardenは、音声処理のための統合された、インストールが容易なツールセットを提供します。PythonやDockerのような複雑なシステムレベルの依存関係を必要とせず、ユーザーがNode.jsを通じて直接、高品質な音声文字起こし、テキスト読み上げ、および音声分析ツールを実行できるようにします。

仕組み

このプロジェクトはTypeScriptで書かれており、Node.jsランタイム上で動作します。純粋なTypeScript実装、WebAssemblyポート、およびONNXランタイムを組み合わせて、AIモデル(WhisperやKokoroなど)をオフラインで実行する一方で、Google、Microsoft、Amazon、およびOpenAIのクラウドベースの音声サービスとの統合も提供します。

対象ユーザー

Node.jsアプリケーションに音声機能を取り入れたい開発者、または音声の文字起こし、翻訳、および合成のための強力なコマンドラインインターフェースを必要とするエンドユーザー向けに設計されています。

ハイライト

  • 包括的な音声スイート: テキスト読み上げ (TTS)、音声文字起こし (STT)、音声活動検知 (VAD)、および音源分離を含みます。
  • wget-freeなインストール: PythonやDockerは不要です。標準的なnpmパッケージとしてインストールされます。
  • 高度なアライメント: 動的時間伸縮法 (DTW) とガイド付きデコーディングを使用して、100以上の言語で音声と書き起こしのアライメントをサポートします。
  • オーディオ拡張: 音声のノイズ除去および、バックグラウンドミュージックや環境音からの音声の分離機能を備えています。
  • 発音の改善: オフラインTTSエンジンの精度を向上させるために、テキスト正規化と異音語の曖昧さ回避を含みます。
  • 単語レベルのタイムスタンプ: すべての認識、合成、および翻訳の出力に対して、正確なタイミング情報を提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト