TheStageAI/TheWhisper

Optimized Whisper models for streaming and on-device use

解決的問題

TheWhisper 提供了一種高效率、低延遲的語音轉文字(STT)解決方案,專為自托管與設備內推論優化。它克服了原始 Whisper 模型需要 30 秒音訊區塊的限制,支援彈性區塊大小(10 秒、15 秒、20 秒、30 秒),無需以靜音填補音訊。

工作原理

本專案提供帶有開放權重的 Whisper 模型微調版本,以及針對不同硬體的專用推論引擎:

  • NVIDIA GPU:使用優化引擎(包括 TheStage AI ElasticModels)實現高吞吐量,例如在 L40s GPU 上達到 220 tok/s。
  • Apple Silicon:使用 CoreML 和 MLX 引擎,將功耗(約 2W)與記憶體使用量(約 2GB)降至最低。
  • 串流處理:在 NVIDIA 與 macOS 平台上實現串流轉錄,支援即時應用。

適用對象

專為需要低功耗與低延遲的即時字幕、即時會議工具、語音介面與邊緣部署應用的開發者設計。

主要特色

  • 彈性區塊處理:支援 10 秒、15 秒、20 秒與 30 秒的音訊區塊,實現更高效的處理。
  • 硬體優化:針對 NVIDIA GPU(RTX 4090/5090、L40s、H100、A100)與 Apple Silicon(M1-M4 系列)提供專用高效能引擎。
  • 設備內部署:包含 Python API 與範例,可用於使用 Electron 與 ReactJS 建構 macOS 桌面應用程式。
  • 串流支援:在支援的平台間原生支援串流轉錄。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案