innovatorved/whisper.api
This project provides an API with user level access support to transcribe speech to text using a finetuned and processed Whisper ASR model.
What it solves
Whisper API 提供了一个自托管、高性能的语音转文字转录服务。它允许用户在保持完整数据所有权的同时,使用与 Deepgram 的 /v1/listen 端点兼容的标准化 API,使其能够轻松地集成到现有应用程序中,而无需更换供应商。
How it works
该项目作为一个围绕 whisper.cpp 的 API 封装器,通过 REST 和 WebSocket 接口公开转录功能。它包括一个用于管理 API 密钥和模型的 CLI,并支持文件上传以及具有内置 SSRF 保护的 URL 转录。
Who it’s for
需要可扩展、私密转录服务,且能与现有的 Deepgram 风格的工作流程无缝衔接的开发者和组织。
Highlights
Deepgram-compatible API: 与
/v1/listen端点兼容。Real-time Streaming: 支持通过 WebSockets 支持 16kHz PCM 转录。
Stabilization: 原生支持 JSON, SRT, 和 VTT 导出格式。
Advanced Transcription: 包括说话人日志 (speaker diarization)、自定义词汇提示 (custom vocabulary prompting) 和音频裁剪 (audio cropping)。
Secure Management: 基于 CLI 的 API 密钥生成和安全的模型管理。