TheStageAI/TheWhisper
Optimized Whisper models for streaming and on-device use
해결하는 문제
TheWhisper는 자체 호스팅 및 디바이스 내 추론에 최적화된 고성능, 저지연 음성-텍스트 변환(STT) 솔루션을 제공합니다. 원본 Whisper 모델이 30초 단위의 오디오 청크를 필요로 하는 한계를 극복하여, 정적 소음을 추가하지 않고도 10초, 15초, 20초, 30초의 유연한 청크 크기를 지원합니다.
작동 방식
이 프로젝트는 오픈 웨이트와 전용 추론 엔진을 갖춘 Whisper 모델의 파인튜닝 버전을 제공합니다. 다양한 하드웨어에 맞게 최적화되어 있습니다:
- NVIDIA GPU: TheStage AI ElasticModels를 포함한 최적화된 엔진을 사용하여 L40s GPU에서 220 tok/s의 높은 처리량을 달성합니다.
- Apple Silicon: CoreML 및 MLX 엔진을 사용하여 전력 소모(
2W)와 RAM 사용량(2GB)을 최소화합니다. - 스트리밍: NVIDIA 및 macOS 플랫폼 모두에서 스트리밍 전사 기능을 구현하여 실시간 애플리케이션을 지원합니다.
대상 사용자
저전력과 저지연이 필요한 실시간 자막, 라이브 회의 도구, 음성 인터페이스, 엣지 배포를 구축하는 개발자들을 위한 것입니다.
주요 특징
- 유연한 청크 처리: 10초, 15초, 20초, 30초의 오디오 청크를 지원하여 더 효율적인 처리를 가능하게 합니다.
- 하드웨어 최적화: NVIDIA GPU(RTX 4090/5090, L40s, H100, A100) 및 Apple Silicon(M1-M4 시리즈)용 전용 고성능 엔진을 제공합니다.
- 디바이스 내 배포: Electron과 ReactJS를 사용한 macOS 데스크톱 애플리케이션 개발을 위한 Python API와 예제를 포함합니다.
- 스트리밍 지원: 지원되는 플랫폼 간에 내장된 스트리밍 전사 기능을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트