absadiki/pywhispercpp
Python bindings for whisper.cpp
解决的问题
为 whisper.cpp 提供简单且符合 Python 风格的 API,使开发者无需直接与底层 C++ 实现交互,即可将高性能语音转文字功能集成到 Python 应用中。
工作原理
该项目作为 whisper.cpp 引擎的 Python 绑定。用户可以加载模型(自动下载或本地提供),并通过 ffmpeg 将音频文件(如 .wav 或 .mp3)转录为文本段。支持多种硬件加速后端,包括 NVIDIA CUDA、CoreML、Vulkan、OpenBLAS 和 OpenVINO。
适用人群
- Python 开发者:希望在使用
whisper.cpp高效性的同时,享受 Python 的易用性。 - AI 助手构建者:使用项目内置的助手示例和语音活动检测(VAD)开发语音激活工具的开发者。
- 终端用户:希望使用简单 CLI 或 GUI 工具转录音频文件的人。
主要亮点
- 多后端支持:兼容 CUDA、CoreML、Vulkan、OpenBLAS 和 OpenVINO,实现性能优化。
- Python 风格 API:提供简单的
Model类进行转录,支持自定义回调函数以实现实时处理。 - 全面的工具链:包含命令行界面(CLI)、基于 PyQt5 的图形用户界面(GUI)以及语音助手示例。
- 直接访问 C-API:高级用户可通过
_pywhispercpp模块访问暴露的 C-API。
相关
- 项目
- 项目
- 项目
- 项目
- 项目