Uberi/speech_recognition

Speech recognition module for Python, supporting several engines and APIs, online and offline.

解決する課題

このライブラリは、Pythonで音声認識を行うための統一されたインターフェースを提供し、開発者がコアロジックを書き換えることなく、異なる音声文字変換エンジンやAPIを簡単に切り替えられるようにします。マイクやファイルから音声をキャプチャしてテキストに変換するプロセスを簡素化し、オンラインのクラウドサービスとオフラインのローカルエンジンの両方をサポートしています。

仕組み

このライブラリは、複数の音声認識バックエンドのラッパーとして機能します。オーディオ入力(マイクの場合はPyAudio経由)を処理するための一貫したツールセットを提供し、そのオーディオを選択した認識エンジンにルーティングします。サポートされているバックエンドは以下の通りです:

  • オフラインエンジン: CMU Sphinx、Vosk、OpenAI Whisper
  • オンラインAPI: Google Speech Recognition、Google Cloud Speech、Wit.ai、Microsoft Azure Speech、Houndify、IBM Speech to Text、OpenAI Transcription API、Groq Whisper API、Cohere Transcribe API

また、周囲のノイズを校正したり、オーディオデータのエンコーディング(例:FLACの使用)を管理したりするためのユーティリティ関数も含まれています。

対象者

音声制御アプリケーション、文字起こしツール、または利用可能な様々なAIモデルやサービスを使用して音声オーディオをテキストに変換する必要があるソフトウェアを構築している開発者。

ハイライト

  • マルチエンジンサポート: 幅広いローカルおよびクラウドベースの音声文字変換プロバイダーと互換性があります。
  • オンラインおよびオフライン: Sphinx、Vosk、またはWhisperを介して、プライバシーや低遅延のニーズのために完全なオフライン認識をサポートしています。
  • 柔軟な入力: マイクから直接、または既存のオーディオファイルからオーディオを処理できます。
  • 周囲のノイズ処理: 背景ノイズをより適切に処理するために、エネルギーしきい値を校正する機能が含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト