innovatorved/whisper.api
This project provides an API with user level access support to transcribe speech to text using a finetuned and processed Whisper ASR model.
What it solves
Whisper API 提供了一個自託管、高效能的語音轉文字轉錄服務。它讓使用者能夠在保持完整數據所有權的同時,使用與 Deepgram 的 /v1/listen 端點相容的標準化 API,使其能夠輕鬆地整合到現有應用程式中,而無需更換供應商。
How it works
該專案作為 whisper.cpp 的 API 包裝器,透過 REST 和 WebSocket 介面公開轉錄功能。它包含一個用於管理 API 金鑰和模型的 CLI,並支援檔案上傳以及具有內建 SSRF 保護的 URL 轉錄。
Who it’s for
需要可擴展、私密轉錄服務,且能與現有的 Deepgram 風格工作流程無縫銜接的開發者和組織。
Highlights
- Deepgram-compatible API: 與
/v1/listen端點相容。 - Real-time Streaming: 透過 WebSockets 支援 16kHz PCM 轉錄。
- Stabilization: 原生支援 JSON, SRT, 和 VTT 匯出格式。
- Advanced Transcription: 包含說話者角色分段 (speaker diarization)、自定義詞彙提示 (custom vocabulary prompting) 以及音訊裁剪 (audio cropping)。
- Secure Management: 基於 CLI 的 API 金鑰生成和安全的模型管理。