senstella/parakeet-mlx
An implementation of the Nvidia's Parakeet models for Apple Silicon using MLX.
해결하는 문제
MLX 프레임워크를 사용하여 Nvidia의 Parakeet 자동 음성 인식(ASR) 모델을 Apple Silicon 하드웨어에서 실행할 수 있는 방법을 제공하여, 효율적인 로컬 오디오 변환을 가능하게 합니다.
작동 방식
이 프로젝트는 MLX에서 Parakeet 모델 아키텍처를 구현하여 Hugging Face에서 사전 훈련된 가중치를 로드할 수 있도록 합니다. 다양한 모델 변형(TDT, RNNT, CTC, TDTCTC)을 지원하며, 그리디 및 비임계 탐색과 같은 다양한 디코딩 방법을 제공합니다. 긴 오디오 파일을 처리하기 위해 청크화 메커니즘과 로컬 어텐션을 포함하여 메모리 사용량을 줄입니다.
대상 사용자
타임스탬프 및 스트리밍 오디오를 지원하는 고성능 로컬 음성-텍스트 변환을 필요로 하는 Apple Silicon 맥을 사용하는 개발자 및 사용자입니다.
주요 특징
- 다양한 출력 형식: TXT, SRT, VTT, JSON 형식으로 변환 결과를 내보낼 수 있습니다.
- 정밀한 타임스탬프: 오디오에 대한 단어 수준 및 문장 수준의 정렬을 제공합니다.
- 스트리밍 지원: 실시간 변환을 위한
transcribe_stream메서드를 포함합니다. - 유연한 디코딩: TDT 모델용으로 비임계 크기, 길이 페널티, 인내심 등의 설정 가능한 파라미터를 제공합니다.
- 메모리 최적화: 긴 오디오 시퀀스를 처리할 때 과도한 메모리 소비 없이도 가능한 로컬 어텐션을 구현합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트