Blaizzy/mlx-audio

A text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.

해결하는 문제

MLX-Audio는 Apple Silicon(M 시리즈 칩)에 특별히 최적화된 고성능 오디오 처리 라이브러리를 제공합니다. 텍스트 음성 변환(TTS), 음성 인식(STT) 및 음성 변환(STS) 작업을 위한 복잡한 오디오 AI 모델의 배포를 단순화하여 사용자가 이러한 모델을 로컬에서 효율적으로 실행할 수 있도록 합니다.

작동 방식

Apple의 MLX 프레임워크를 기반으로 구축된 이 라이브러리는 커뮤니티의 다양한 사전 학습된 모델을 통합합니다. 다음과 같은 멀티모달을 지원합니다:

  • Text-to-Speech (TTS): 음성 클로닝, 다국어 출력 및 감정 제어를 지원하여 텍스트에서 자연스러운 음성을 생성합니다.
  • Speech-to-Text (STT): 단어 수준의 정렬, 화자 분리(누가 말하는지 식별) 및 스트리밍 전사를 포함한 오디오의 텍스트 변환.
  • Speech-to-Speech (STS): 소스 분리, 음성 향상 및 노이즈 억제와 같은 작업을 처리합니다.
  • VAD/Diarization: 음성 활동 감지 및 화자 분리.

대상 사용자

  • macOS 및 iOS용 오디오 중심 애플리케이션을 구축하는 개발자.
  • Apple 하드웨어에서 최첨단 오디오 모델을 실행하고자 하는 연구자.
  • 클라우드 API에 의존하지 않고 빠르고 로컬이며 프라이빗한 오디오 처리가 필요한 사용자.

주요 특징

  • Apple Silicon 최적화: M 시리즈 칩에 맞춤화된 빠른 추론.
  • 호환 가능한 API: OpenAI 호환 REST API 및 3D 오디오 시각화 기능이 있는 웹 인터페이스 포함.
  • 광범위한 모델 지원: Whisper, Kokoro, Qwen3-TTS, VibeVoice-ASR 등 수십 개의 모델 통합.
  • C-level 통합: 네이티브 iOS/macOS 통합을 위한 Swift 패키지 제공.
  • 성능 튜닝: 메모리 사용량을 줄이고 속도를 높이기 위한 양자화(3-bit ~ 8-bit) 지원.