absadiki/pywhispercpp
Python bindings for whisper.cpp
解決的問題
為 whisper.cpp 提供簡單且符合 Python 風格的 API,讓開發者無需直接與底層 C++ 實作互動,即可將高效率的語音轉文字功能整合至 Python 應用程式中。
運作方式
本專案作為 whisper.cpp 引擎的 Python 繫結。使用者可載入模型(自動下載或本地提供),並透過 ffmpeg 將音訊檔案(如 .wav 或 .mp3)轉錄為文字段落。支援多種硬體加速後端,包括 NVIDIA CUDA、CoreML、Vulkan、OpenBLAS 與 OpenVINO。
適用對象
- Python 開發者:希望兼具
whisper.cpp的高效性與 Python 的易用性。 - AI 助手建構者:使用專案內建的助理範例與語音活動偵測(VAD)開發語音啟動工具的開發者。
- 終端使用者:希望使用簡單的 CLI 或 GUI 工具轉錄音訊檔案的人。
主要特色
- 多後端支援:相容 CUDA、CoreML、Vulkan、OpenBLAS 與 OpenVINO,實現最佳化效能。
- Python 風格 API:提供簡單的
Model類別進行轉錄,支援自訂回呼函式以實作即時處理。 - 完整的工具鏈:包含命令列介面(CLI)、基於 PyQt5 的圖形使用者介面(GUI)與語音助理範例。
- 直接存取 C-API:進階使用者可透過
_pywhispercpp模組存取公開的 C-API。
相關
- 專案
- 專案
- 專案
- 專案
- 專案