Blaizzy/mlx-audio
A text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.
해결하는 문제
MLX-Audio는 Apple Silicon(M 시리즈 칩)에 특별히 최적화된 고성능 오디오 처리 라이브러리를 제공합니다. 텍스트 음성 변환(TTS), 음성 인식(STT) 및 음성 변환(STS) 작업을 위한 복잡한 오디오 AI 모델의 배포를 단순화하여 사용자가 이러한 모델을 로컬에서 효율적으로 실행할 수 있도록 합니다.
작동 방식
Apple의 MLX 프레임워크를 기반으로 구축된 이 라이브러리는 커뮤니티의 다양한 사전 학습된 모델을 통합합니다. 다음과 같은 멀티모달을 지원합니다:
- Text-to-Speech (TTS): 음성 클로닝, 다국어 출력 및 감정 제어를 지원하여 텍스트에서 자연스러운 음성을 생성합니다.
- Speech-to-Text (STT): 단어 수준의 정렬, 화자 분리(누가 말하는지 식별) 및 스트리밍 전사를 포함한 오디오의 텍스트 변환.
- Speech-to-Speech (STS): 소스 분리, 음성 향상 및 노이즈 억제와 같은 작업을 처리합니다.
- VAD/Diarization: 음성 활동 감지 및 화자 분리.
대상 사용자
- macOS 및 iOS용 오디오 중심 애플리케이션을 구축하는 개발자.
- Apple 하드웨어에서 최첨단 오디오 모델을 실행하고자 하는 연구자.
- 클라우드 API에 의존하지 않고 빠르고 로컬이며 프라이빗한 오디오 처리가 필요한 사용자.
주요 특징
- Apple Silicon 최적화: M 시리즈 칩에 맞춤화된 빠른 추론.
- 호환 가능한 API: OpenAI 호환 REST API 및 3D 오디오 시각화 기능이 있는 웹 인터페이스 포함.
- 광범위한 모델 지원: Whisper, Kokoro, Qwen3-TTS, VibeVoice-ASR 등 수십 개의 모델 통합.
- C-level 통합: 네이티브 iOS/macOS 통합을 위한 Swift 패키지 제공.
- 성능 튜닝: 메모리 사용량을 줄이고 속도를 높이기 위한 양자화(3-bit ~ 8-bit) 지원.