Blaizzy/mlx-audio-swift

A modular Swift SDK for audio processing with MLX on Apple Silicon

What it solves

MLX Audio Swift는 macOS 및 iOS 애플리케이션에 고급 오디오 AI 기능을 통합하기 위한 통합된 모듈형 Swift SDK를 제공합니다. 개발자가 MLX 프레임워크를 사용하여 Apple Silicon에서 고성능 오디오 모델(텍스트 음성 변환, 음성 텍스트 변환, 화자 분리 포함)을 직접 실행할 수 있게 함으로써 복잡한 Python 환경의 필요성을 제거합니다.

How it works

이 SDK는 개발자가 애플리케이션 크기를 작게 유지할 수 있도록 개별적으로 임포트할 수 있는 모듈형 컴포넌트로 구성되어 있습니다. Apple Silicon에서의 하드웨어 가속을 위해 MLX 프레임워크를 활용하며, HuggingFace Hub와 통합되어 모델을 자동으로 다운로드합니다. 시스템은 다음과 같은 전문화된 파이프라인을 지원합니다:

  • TTS (Text-to-Speech): 텍스트를 오디오 파형으로 변환합니다.
  • STT (Speech-to-Text): 텍스트를 오디오로 변환합니다.
  • STT (Speech-to-Text): 음성을 텍스트로 전사합니다.
  • VAD/Diarization: 음성 활동을 감지하고 녹음된 내용에서 서로 다른 화자를 식별합니다.
  • Codecs: 효율적인 처리를 위해 오디오를 토큰으로 인코딩 및 디코딩합니다.
  • STS (Speech-to-Speech): 오디오-투-오디오 변환을 처리합니다.

Who it’s for

외부 API나 Python에 의존하지 않고 온디바이스 AI 오디오 처리를 구현하고자 하는 macOS (14+) 및 iOS (17+)용 오디오 중심 애플리케이션을 구축하는 Swift 개발자.

Highlights

  • Modular Design: 프로젝트에 필요한 특정 모듈(예: MLXAudioTTS, MLXAudioSTT)만 임포트할 수 있습니다.
  • Extensive Model Support: Whisper, Qwen3, Fish Audio를 포함한 다양한 모델을 지원합니다.
  • Apple Silicon Optimized: MLX Swift를 사용하여 M-series 칩에 최적화되어 구축되었습니다.
  • Sreaming Support: TTS를 위한 실시간 오디오 생성 기능이 가능합니다.
  • SwiftUI Integration: 오디오 인터페이스 구축을 위한 전용 MLXAudioUI 모듈이 포함되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트