soniqo/speech-swift

AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML

해결하는 문제

Speech Swift는 Mac 및 iOS 기기에서 고성능 로컬 AI 음성 처리를 가능하게 합니다. 클라우드 처리나 API 키가 필요하지 않으므로 오디오 데이터가 사용자의 기지를 벗어나지 않도록 보장하며, 실시간 애플리케이션을 위한 저지연 기능을 제공합니다.

작동 원리

MLX Swift 및 CoreML을 사용하여 구축된 이 라이브러리는 개발자가 Apple Silicon(Neural Engine 포함)에서 다양한 특화된 모델을 직접 실행할 수 있도록 합니다. 모듈식 구조로 설계되어 개발자가 특정 ASR, TTS 또는 LLM 모듈과 같이 필요한 특정 SPM (Swift Package Manager) 제품만 가져올 수 있습니다.

대상 사용자

  • 개인정보 보호 중심의 음성 에이전트 또는 텍스트 변환 도구를 구축하는 iOS 및 macOS 개발자
  • 고성능 온디바이스 음성-to-텍스트 (STT), 텍스트-to-음성 (TTS) 및 음성-to-음성 기능을 찾는 AI 엔지니어
  • 클라우드 의존성 없이 실시간 받아쓰기, 보이스 클로닝 또는 오디오 향상 기능이 필요한 앱 제작자

주요 특징

  • 포괄적인 음성 제품군: 자동 음성 인식 (ASR), 텍스트-to-음성 (TTS), 음성-to-음성 번역 및 오디오 향상을 지원합니다.
  • 온디바이스 프라이버시: 모든 처리가 로컬에서 이루어져 데이터 보안과 오프라인 기능을 보장합니다.
  • 광범위한 모델 지원: Whisper, Qwen, Kokoro 등을 포함하여 수백 개의 언어를 지원하는 구현체가 포함되어 있습니다.
  • 모듈형 아키텍처: Swift Package Manager 통합을 통해 필요한 모듈만 가져와 가벼운 빌드가 가능합니다.
  • 고성능: Apple Silicon에 최적화되어 Neural Engine을 활용함으로써 저지연 스트리밍과 높은 실시간 계수 (RTF) 효율성을 제공합니다.