TheStageAI/TheWhisper
Optimized Whisper models for streaming and on-device use
解決的問題
TheWhisper 提供了一種高效率、低延遲的語音轉文字(STT)解決方案,專為自托管與設備內推論優化。它克服了原始 Whisper 模型需要 30 秒音訊區塊的限制,支援彈性區塊大小(10 秒、15 秒、20 秒、30 秒),無需以靜音填補音訊。
工作原理
本專案提供帶有開放權重的 Whisper 模型微調版本,以及針對不同硬體的專用推論引擎:
- NVIDIA GPU:使用優化引擎(包括 TheStage AI ElasticModels)實現高吞吐量,例如在 L40s GPU 上達到 220 tok/s。
- Apple Silicon:使用 CoreML 和 MLX 引擎,將功耗(約 2W)與記憶體使用量(約 2GB)降至最低。
- 串流處理:在 NVIDIA 與 macOS 平台上實現串流轉錄,支援即時應用。
適用對象
專為需要低功耗與低延遲的即時字幕、即時會議工具、語音介面與邊緣部署應用的開發者設計。
主要特色
- 彈性區塊處理:支援 10 秒、15 秒、20 秒與 30 秒的音訊區塊,實現更高效的處理。
- 硬體優化:針對 NVIDIA GPU(RTX 4090/5090、L40s、H100、A100)與 Apple Silicon(M1-M4 系列)提供專用高效能引擎。
- 設備內部署:包含 Python API 與範例,可用於使用 Electron 與 ReactJS 建構 macOS 桌面應用程式。
- 串流支援:在支援的平台間原生支援串流轉錄。
相關
- 專案
- 專案
- 專案
- 專案
- 專案