KoljaB/RealtimeSTT

A robust, efficient, low-latency speech-to-text library with advanced voice activity detection, wake word activation and instant transcription.

何を解決するか

RealtimeSTTは、音声オーディオをリアルタイムでテキストに変換するプロセスを簡素化します。音声活動検知(VAD)、ウェイクワードの起動、およびオーディオストリーム処理を手動で管理する複雑さを排除し、開発者が最小限のコードでアシスタントやディクテーションツールに音声文字起こし機能を統合できるようにします。

仕組み

このライブラリは、マイクから直接オーディオをキャプチャしたり、外部ソースからPCMオーディオチャンクを受信したりできるAudioToTextRecorderを提供します。文字起こしを実行するために、モジュール式のエンジンシステム(デフォルトはfaster_whisperですが、sherpa-onnxkroko-onnxなどの他のエンジンもサポートしています)を使用します。VAD(WebRTCまたはSilero経由)を使用してユーザーが話し始めた時と話し終えた時を検出し、ウェイクワード(PorcupineまたはOpenWakeWord経由)を統合して録音をトリガーすることができます。

対象ユーザー

音声制御AIアシスタント、ディクテーションソフトウェア、ブラウザベースのストリーミングサーバー、および高速でローカルな音声文字起こし機能が必要な迅速なプロトタイプを構築している開発者向けに設計されています。

ハイライト

  • マルチエンジンサポート: faster-whisper、sherpa-onnx、およびKroko-ONNXを含むさまざまなバックエンドと互換性があります。
  • リアルタイム更新: 即時のテキスト仮説と、最終的な確定済み文字起こし結果の両方をサポートします。
  • 柔軟なオーディオ入力: ライブマイクまたは外部オーディオストリーム(ファイル、websockets)で動作します。
  • プロダクション対応: WebSocketサポート、認証、およびセッション分離を備えたパッケージ化されたFastAPIサーバーが含まれています。
  • 統合されたVADとウェイクワード: 音声の検出および特定のトリガーワードの検出のための組み込みサポートを提供します。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト