absadiki/pywhispercpp

Python bindings for whisper.cpp

解決的問題

whisper.cpp 提供簡單且符合 Python 風格的 API,讓開發者無需直接與底層 C++ 實作互動,即可將高效率的語音轉文字功能整合至 Python 應用程式中。

運作方式

本專案作為 whisper.cpp 引擎的 Python 繫結。使用者可載入模型(自動下載或本地提供),並透過 ffmpeg 將音訊檔案(如 .wav.mp3)轉錄為文字段落。支援多種硬體加速後端,包括 NVIDIA CUDA、CoreML、Vulkan、OpenBLAS 與 OpenVINO。

適用對象

  • Python 開發者:希望兼具 whisper.cpp 的高效性與 Python 的易用性。
  • AI 助手建構者:使用專案內建的助理範例與語音活動偵測(VAD)開發語音啟動工具的開發者。
  • 終端使用者:希望使用簡單的 CLI 或 GUI 工具轉錄音訊檔案的人。

主要特色

  • 多後端支援:相容 CUDA、CoreML、Vulkan、OpenBLAS 與 OpenVINO,實現最佳化效能。
  • Python 風格 API:提供簡單的 Model 類別進行轉錄,支援自訂回呼函式以實作即時處理。
  • 完整的工具鏈:包含命令列介面(CLI)、基於 PyQt5 的圖形使用者介面(GUI)與語音助理範例。
  • 直接存取 C-API:進階使用者可透過 _pywhispercpp 模組存取公開的 C-API。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案