innovatorved/whisper.api
This project provides an API with user level access support to transcribe speech to text using a finetuned and processed Whisper ASR model.
What it solves
Whisper API는 자가 호스팅 방식의 고성text-to-text 전사(transcription) 서비스를 제공합니다. 사용자는 Deepgram의 /v1/listen 엔드포인트와 호환되는 표준화된 API를 사용하여 데이터 소유권을 완전히 유지하면서, 기존 애플리케이션에 공급업체를 변경하지 않고도 쉽게 통합할 수 있습니다.
How it works
이 프로젝트는 whisper.cpp를 API 래퍼로 사용하여, OpenAI의 Whisper 모델의 전사 기능을 REST 및 WebSocket 인터페이스를 통해 제공합니다. API 키와 모델을 관리하기 위한 CLI가 포함되어 있으며, 파일 업로드 및 내장 SSRF 보호 기능이 있는 URL 전사 기능을 지원합니다.
Who it’s for
기존 Deepgram 스타일의 워크플로우와 즉시 호환되는 확장 가능하고 프라이빗한 전사 서비스를 필요로 하는 개발자 및 조직.
Highlights
- Deepgram-compatible API:
/v1/listen엔드포인트를 지원합니다. - Real-time Streaming: WebSocket을 통해 16kHz PCM 전사를 지원합니다.
- Stabilization: JSON, SRT, 및 VTT 내보내기 형식을 네이티브 지원합니다.
- Advanced Transcription: 화자 분리(speaker diarization), 사용자 정의 어휘 프롬프트(custom vocabulary prompting), 및 오디오 크로핑(audio cropping)을 포함합니다.
- Secure Management: CLI 기반의 API 키 생성 및 안전한 모델 관리.