innovatorved/whisper.api

This project provides an API with user level access support to transcribe speech to text using a finetuned and processed Whisper ASR model.

What it solves

Whisper API は、自己ホスト型の高性能な音声文字起こしサービスを提供します。ユーザーは、Deepgram の /v1/listen エンドポイントと互換性のある標準化された API を使用することで、データの完全な所有権を維持しながら、既存のアプリケーションにプロバイダーを切り替えることなく、簡単に統合できます。

How it works

このプロジェクトは whisper.cpp の API ラッパーとして機能し、OpenAI の Whisper モデルの文字起こし機能を REST と WebSocket インターフェース経由で公開します。API キーとモデルを管理するための CLI が含まれており、ファイルアップロードおよび SSRF 保護機能付きの URL からの文字起こしをサポートしています。

Who it’s for

既存の Deepgram スタイルのワークフローにそのまま置き換え可能な、スケーラブルでプライベートな文字起こしサービスをが必要とする開発者や組織。

Highlights

  • Deepgram-compatible API: /v1/listen エンドポイントとの互換性があります。

  • Real-time Streaming: WebSocket を介して 16kHz PCM 文字起こしをサポートします。

  • Stabilization: JSON, SRT, および VTT 形式でのエクスポートをネイティブサポートしています。

  • Advanced Transcription: 話者分離 (speaker diarization)、カスタム語彙プロンプティング (custom vocabulary prompting)、およびオーディオクロップ (audio cropping) を含みます。

  • Secure Management: CLI ベースの API キー生成と安全なモデル管理。