ahmetoner/whisper-asr-webservice

OpenAI Whisper ASR Webservice API

해결하는 문제

OpenAI의 Whisper 모델을 위한 즉시 사용 가능한 REST API 래퍼를 제공하여, 사용자가 자체 서버 인프라를 구축할 필요 없이 다른 애플리케이션에 음성-텍스트 변환 기능을 쉽게 배포하고 통합할 수 있도록 합니다.

작동 방식

이 프로젝트는 여러 고성능 Whisper 엔진(OpenAI Whisper, Faster Whisper, WhisperX)을 Docker화된 웹 서비스로 래핑합니다. FFmpeg를 사용하여 다양한 오디오 및 비디오 형식을 처리하며, 오디오 파일을 전송하고 전사(transcription)를 받기 위한 Swagger 문서가 포함된 REST API를 제공합니다.

대상 사용자

다양한 모델과 출력 형식(자막을 위한 SRT 또는 VTT 등)을 지원하고 CPU 또는 GPU에서 실행 가능한 셀프 호스팅 음성 인식 서비스를 배포해야 하는 개발자.

주요 특징

  • 다중 엔진 지원: OpenAI Whisper, Faster Whisper, WhisperX를 지원합니다.
  • 유연한 출력: 전사 결과는 text, JSON, VTT, SRT 또는 TSV로 내보낼 수 있습니다.
  • 고급 전사 기능: WhisperX를 통한 단어 단위 타임스탬프, 음성 활동 감지(VAD) 필터링 및 화자 분리(diarization)를 포함합니다.
  • 쉬운 배포: CPU 및 GPU 가속을 위한 Docker 이미지로 제공됩니다.
  • 폭넓은 형식 지원: FFmpeg와 통합되어 광범위한 오디오/비디오 호환성을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트