absadiki/pywhispercpp

Python bindings for whisper.cpp

何を解決するか

whisper.cpp 用のシンプルで Python スタイルな API を提供し、開発者が直接 C++ 実装にアクセスせずに、高パフォーマンスな音声認識を Python アプリケーションに統合できるようにします。

動作方法

このプロジェクトは whisper.cpp エンジン用の Python バインディングです。ユーザーはモデルをロード(自動ダウンロードまたはローカルで提供)し、音声ファイル(ffmpeg を通じて .wav.mp3 など)をテキストセグメントに変換できます。NVIDIA CUDA、CoreML、Vulkan、OpenBLAS、OpenVINO などのさまざまなハードウェアアクセラレーションバックエンドをサポートしています。

対象ユーザー

  • Python 開発者: whisper.cpp の効率性と Python の使いやすさを両方得たい人。
  • AI アシスタント構築者: プロジェクトの組み込みアシスタント例と音声活動検出(VAD)を使って音声起動ツールを開発したい人。
  • エンドユーザー: 音声ファイルを変換するためのシンプルな CLI や GUI ツールを使いたい人。

特徴

  • マルチバックエンド対応: CUDA、CoreML、Vulkan、OpenBLAS、OpenVINO に対応し、パフォーマンスを最適化。
  • Python スタイル API: 簡単な Model クラスで変換可能。リアルタイム処理用のカスタムコールバックもサポート。
  • 包括的なツールキット: コマンドラインインターフェース(CLI)、PyQt5 ベースのグラフィカルユーザーインターフェース(GUI)、音声アシスタントの例を含む。
  • 直接 C-API アクセス: 上級ユーザーは _pywhispercpp モジュールを通じて公開された C-API にアクセス可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト