innovatorved/whisper.api

This project provides an API with user level access support to transcribe speech to text using a finetuned and processed Whisper ASR model.

What it solves

Whisper API 提供了一个自托管、高性能的语音转文字转录服务。它允许用户在保持完整数据所有权的同时,使用与 Deepgram 的 /v1/listen 端点兼容的标准化 API,使其能够轻松地集成到现有应用程序中,而无需更换供应商。

How it works

该项目作为一个围绕 whisper.cpp 的 API 封装器,通过 REST 和 WebSocket 接口公开转录功能。它包括一个用于管理 API 密钥和模型的 CLI,并支持文件上传以及具有内置 SSRF 保护的 URL 转录。

Who it’s for

需要可扩展、私密转录服务,且能与现有的 Deepgram 风格的工作流程无缝衔接的开发者和组织。

Highlights

  • Deepgram-compatible API: 与 /v1/listen 端点兼容。

  • Real-time Streaming: 支持通过 WebSockets 支持 16kHz PCM 转录。

  • Stabilization: 原生支持 JSON, SRT, 和 VTT 导出格式。

  • Advanced Transcription: 包括说话人日志 (speaker diarization)、自定义词汇提示 (custom vocabulary prompting) 和音频裁剪 (audio cropping)。

  • Secure Management: 基于 CLI 的 API 密钥生成和安全的模型管理。