innovatorved/whisper.api
This project provides an API with user level access support to transcribe speech to text using a finetuned and processed Whisper ASR model.
What it solves
Whisper API は、自己ホスト型の高性能な音声文字起こしサービスを提供します。ユーザーは、Deepgram の /v1/listen エンドポイントと互換性のある標準化された API を使用することで、データの完全な所有権を維持しながら、既存のアプリケーションにプロバイダーを切り替えることなく、簡単に統合できます。
How it works
このプロジェクトは whisper.cpp の API ラッパーとして機能し、OpenAI の Whisper モデルの文字起こし機能を REST と WebSocket インターフェース経由で公開します。API キーとモデルを管理するための CLI が含まれており、ファイルアップロードおよび SSRF 保護機能付きの URL からの文字起こしをサポートしています。
Who it’s for
既存の Deepgram スタイルのワークフローにそのまま置き換え可能な、スケーラブルでプライベートな文字起こしサービスをが必要とする開発者や組織。
Highlights
Deepgram-compatible API:
/v1/listenエンドポイントとの互換性があります。Real-time Streaming: WebSocket を介して 16kHz PCM 文字起こしをサポートします。
Stabilization: JSON, SRT, および VTT 形式でのエクスポートをネイティブサポートしています。
Advanced Transcription: 話者分離 (speaker diarization)、カスタム語彙プロンプティング (custom vocabulary prompting)、およびオーディオクロップ (audio cropping) を含みます。
Secure Management: CLI ベースの API キー生成と安全なモデル管理。