absadiki/pywhispercpp
Python bindings for whisper.cpp
何を解決するか
whisper.cpp 用のシンプルで Python スタイルな API を提供し、開発者が直接 C++ 実装にアクセスせずに、高パフォーマンスな音声認識を Python アプリケーションに統合できるようにします。
動作方法
このプロジェクトは whisper.cpp エンジン用の Python バインディングです。ユーザーはモデルをロード(自動ダウンロードまたはローカルで提供)し、音声ファイル(ffmpeg を通じて .wav や .mp3 など)をテキストセグメントに変換できます。NVIDIA CUDA、CoreML、Vulkan、OpenBLAS、OpenVINO などのさまざまなハードウェアアクセラレーションバックエンドをサポートしています。
対象ユーザー
- Python 開発者:
whisper.cpp の効率性と Python の使いやすさを両方得たい人。
- AI アシスタント構築者: プロジェクトの組み込みアシスタント例と音声活動検出(VAD)を使って音声起動ツールを開発したい人。
- エンドユーザー: 音声ファイルを変換するためのシンプルな CLI や GUI ツールを使いたい人。
特徴
- マルチバックエンド対応: CUDA、CoreML、Vulkan、OpenBLAS、OpenVINO に対応し、パフォーマンスを最適化。
- Python スタイル API: 簡単な
Model クラスで変換可能。リアルタイム処理用のカスタムコールバックもサポート。
- 包括的なツールキット: コマンドラインインターフェース(CLI)、PyQt5 ベースのグラフィカルユーザーインターフェース(GUI)、音声アシスタントの例を含む。
- 直接 C-API アクセス: 上級ユーザーは
_pywhispercpp モジュールを通じて公開された C-API にアクセス可能。
関連
- プロジェクト
openai/whisperWhisperは、多言語の文字起こし、言語識別、翻訳を処理するOpenAIのオープンソースのTransformerベースの音声対テキストシステムです。6つのモデルサイズ(tinyからlarge、および高速な「turbo」バリアント)を備えたpipインストール可能なパッケージとして提供されます。CLI (`whisper …`) とシンプルなPython API (`whisper.load_model(...).transcribe(...)`) を使用して、わずかなコマンドで音声ファイルをテキストに変換できます。このプロジェクトはPython 3.8-3.11、PyTorchで動作し、ffmpeg(およびオプションでトークナイザー用のRust)が必要です。すべてのコードとモデルの重みはMITライセンスです。
- プロジェクト
sandrohanea/whisper.netwhisper.cpp を介して OpenAI Whisper の .NET バインディングを提供し、広範なハードウェアアクセラレーションをサポートすることで、.NET アプリケーションでのローカルな音声-テキスト変換および翻訳を実現します。
- プロジェクト
Uberi/speech_recognitionOpenAI Whisper、Google Speech、Voskなどの複数のオンラインおよびオフラインエンジンをサポートする、音声認識のための統一インターフェースを提供するPythonライブラリ。
- プロジェクト
- プロジェクト
collabora/WhisperLiveWhisperLiveは、OpenAIのWhisperモデルを基盤としたオープンソースのニアリアルタイム音声認識サーバーです。複数の推論バックエンド(faster-whisper、NVIDIA TensorRT、Intel OpenVINO、AMD ROCm)をサポートし、単語レベルのタイムスタンプ、ホットワード強調、話者分離、オプションの翻訳機能を提供。シンプルなコマンドラインクライアントとPythonストリーミングAPIを備え、GPUおよびCPU用のDockerイメージを提供。ブラウザやiOS拡張機能により、ウェブページやモバイルデバイスから直接音声を認識できます。