TheStageAI/TheWhisper
Optimized Whisper models for streaming and on-device use
解决的问题
TheWhisper 提供了一种高性能、低延迟的语音转文本(STT)解决方案,专为自托管和设备内推理优化。它克服了原始 Whisper 模型需要 30 秒音频块的限制,支持灵活的块大小(10 秒、15 秒、20 秒和 30 秒),而无需用静音填充音频。
工作原理
该项目提供了带有开放权重的 Whisper 模型的微调版本,以及针对不同硬件的专用推理引擎:
- NVIDIA GPU:使用优化的引擎(包括 TheStage AI ElasticModels)实现高吞吐量,例如在 L40s GPU 上达到 220 tok/s。
- Apple Silicon:使用 CoreML 和 MLX 引擎,将功耗(约 2W)和内存使用量(约 2GB)降至最低。
- 流式传输:在 NVIDIA 和 macOS 平台上实现流式转录,以支持实时应用。
适用人群
专为需要低功耗和低延迟的实时字幕、实时会议工具、语音界面和边缘部署应用的开发者设计。
主要亮点
- 灵活分块:支持 10 秒、15 秒、20 秒和 30 秒的音频块,实现更高效的处理。
- 硬件优化:为 NVIDIA GPU(RTX 4090/5090、L40s、H100、A100)和 Apple Silicon(M1-M4 系列)提供专用高性能引擎。
- 设备内部署:包含 Python API 和示例,可用于使用 Electron 和 ReactJS 构建 macOS 桌面应用程序。
- 流式支持:在支持的平台上原生支持流式转录。
相关
- 项目
- 项目
- 项目
- 项目
- 项目