absadiki/pywhispercpp
Python bindings for whisper.cpp
해결하는 문제
whisper.cpp 를 위한 간단하고 파이썬스러운 API를 제공하여, 개발자가 직접 C++ 구현에 접근하지 않고도 고성능 음성-텍스트 변환 기능을 파이썬 애플리케이션에 통합할 수 있도록 합니다.
작동 방식
이 프로젝트는 whisper.cpp 엔진용 파이썬 바인딩 역할을 합니다. 사용자는 모델을 로드(자동 다운로드 또는 로컬 제공)하고, ffmpeg 를 통해 .wav 또는 .mp3 등의 오디오 파일을 텍스트 세그먼트로 변환할 수 있습니다. NVIDIA CUDA, CoreML, Vulkan, OpenBLAS, OpenVINO 등의 다양한 하드웨어 가속 백엔드를 지원합니다.
대상 사용자
- 파이썬 개발자:
whisper.cpp 의 효율성과 파이썬의 사용 편의성을 모두 원하는 사람.
- AI 어시스턴트 개발자: 프로젝트의 내장 어시스턴트 예제와 음성 활동 탐지(VAD)를 사용해 음성 활성화 도구를 개발하고자 하는 사람.
- 최종 사용자: 오디오 파일을 변환하기 위한 간단한 CLI 또는 GUI 도구를 원하는 사람.
주요 특징
- 다중 백엔드 지원: CUDA, CoreML, Vulkan, OpenBLAS, OpenVINO 등으로 최적화된 성능을 제공합니다.
- 파이썬스러운 API: 간단한
Model 클래스로 변환 가능하며, 실시간 처리를 위한 사용자 정의 콜백도 지원합니다.
- 포괄적인 도구 세트: 명령줄 인터페이스(CLI), PyQt5 기반 그래픽 사용자 인터페이스(GUI), 음성 어시스턴트 예제 포함.
- 직접 C-API 접근: 고급 사용자는
_pywhispercpp 모듈을 통해 노출된 C-API에 직접 접근할 수 있습니다.
관련
- 프로젝트
openai/whisperWhisper는 OpenAI의 오픈 소스 트랜스포머 기반 음성-텍스트 변환 시스템으로, 다양한 언어에 대해 전사, 언어 식별 및 번역을 처리합니다. 6가지 모델 크기(tiny → large, 그리고 빠른 "turbo" 변체)를 갖춘 pip 설치 가능 패키지로 제공됩니다. CLI (`whisper …`)와 간단한 Python API (`whisper.load_model(...).transcribe(...)`)를 사용하면 몇 가지 명령만으로 오디오 파일을 텍스트로 변환할 수 있습니다. 이 프로젝트는 Python 3.8-3.11, PyTorch에서 실행되며 ffmpeg(및 선택적으로 토크나이저용 Rust)가 필요합니다. 모든 코드와 모델 가중치는 MIT 라이선스입니다.
- 프로젝트
sandrohanea/whisper.netwhisper.cpp를 통해 OpenAI Whisper의 .NET 바인딩을 제공하여, 광범위한 하드웨어 가속 지원을 통해 .NET 애플리케이션에서 로컬 음성-텍스트 변환 및 번역을 가능하게 합니다.
- 프로젝트
Uberi/speech_recognitionOpenAI Whisper, Google Speech, Vosk와 같은 다양한 온라인 및 오프라인 엔진을 지원하는 음성 인식용 통합 인터페이스를 제공하는 Python 라이브러리입니다.
- 프로젝트
- 프로젝트
collabora/WhisperLiveWhisperLive는 OpenAI의 Whisper 모델을 기반으로 한 오픈소스의 실시간 가까운 음성 인식 서버입니다. 여러 추론 백엔드(faster-whisper, NVIDIA TensorRT, Intel OpenVINO, AMD ROCm)를 지원하며, 단어 수준 타임스탬프, 핫워드 강조, 스피커 다이어리제이션 및 선택적 번역 기능을 제공합니다. 간단한 명령줄 클라이언트와 Python 스트리밍 API를 제공하며, GPU 및 CPU용 Docker 이미지를 제공합니다. 브라우저 및 iOS 확장 기능을 통해 웹 페이지나 모바일 기기에서 직접 오디오를 인식할 수 있습니다.