dimastatz/whisper-flow

Whisper-Flow is a framework designed to enable real-time transcription of audio content using OpenAI’s Whisper model. Rather than processing entire files after upload (“batch mode”), Whisper-Flow accepts a continuous stream of audio chunks and produces incremental transcripts immediately.

해결하는 문제

Whisper Flow는 OpenAI의 Whisper 모델을 배치 처리 도구에서 실시간 음성 인식 서비스로 전환합니다. 전체 오디오 파일이 업로드되고 처리된 후에야 전사 결과를 받는 데서 발생하는 지연 문제를 해결하며, 애플리케이션 내에서 즉시 스트리밍 음성-텍스트 기능을 사용할 수 있도록 합니다.

작동 방식

이 프로젝트는 순차적인 패킷 또는 '체크'로 전달되는 스트리밍 오디오 데이터를 처리하기 위해 "터블링 윈도우" 기법을 사용합니다. 자연스러운 발화 패턴(예: 정지, 화자 변경)을 기반으로 오디오 스트림을 세그먼트로 분할합니다. 오디오가 처리되는 동안 부분적인 전사 이벤트의 시리즈가 반환되며, 최종 세그먼트가 완료될 때까지 지속적으로 업데이트됩니다.

대상 사용자

Whisper 모델을 사용하여 소프트웨어에 실시간, 저지연 음성-텍스트 기능을 통합하고자 하는 개발자들, 그리고 스트리밍 오디오 세션을 관리하기 위한 Python 라이브러리가 필요한 사용자들.

주요 특징

  • 실시간 스트리밍: 파일을 배치로 처리하는 대신 오디오 청크를 즉시 텍스트로 변환합니다.
  • 저지연: M1 맥 하드웨어에서 500ms 미만의 지연을 기록했습니다.
  • 유연한 배포: WebSockets를 통해 독립형 FastAPI 서버로 실행하거나, Python 라이브러리로 통합할 수 있습니다.
  • PCM 오디오 지원: 16 kHz, 모노, 16비트 부호 있는 정수 오디오 데이터에 특화되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트