soniqo/speech-swift
AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML
Speech Swift – Apple Silicon을 위한 디바이스 내 음성 AI
무엇인가요
- Mac과 iOS 기기에서 로컬로 실행되는 현대적인 음성 관련 모델(ASR, TTS, 정렬, 번역, 음성 에이전트, 강화 등)을 대량으로 묶은 Swift 패키지.
- Apple의 Core ML 런타임(신경 엔진 포함)과 오픈소스 MLX 프레임워크를 사용하여 클라우드 서비스나 API 키 없이 모델을 실행.
왜 중요한가요
- 모든 처리가 디바이스 내에서 이루어지므로 개인정보 보호를 유지하고 지연을 피하며 오프라인에서도 작동 가능.
- 매우 광범위한 언어 지원(최대 1,672개 언어의 Omnilingual ASR)과 다양한 작업을 지원하며, 단순한 음성 입력부터 풀 듀플렉스 음성 대화 에이전트까지 가능.
- 모델은 FP16, INT8, INT5, INT4 등 여러 가지 양자화 형태로 제공되어 하드웨어에 맞게 속도, 메모리, 품질 간의 균형을 조정할 수 있음.
주요 기능
| 카테고리 | 예시 모델 (크기) | 기능 |
|---|---|---|
| 음성 → 텍스트 (ASR) | Qwen3‑ASR (0.6‑1.7 B), Whisper‑ASR (Large‑v3 Turbo), Omnilingual (300 M‑7 B, 1,672 언어) | 오디오를 텍스트로 변환하며, 발화자 분리 및 타임스탬프 옵션 제공. |
| 정렬 | Qwen3‑ForcedAligner (0.6 B) | 주어진 텍스트에 대해 단어 수준의 타임스탬프 생성. |
| 텍스트 → 음성 (TTS) | Qwen3‑TTS (0.6‑1.7 B), CosyVoice (0.5 B), Kokoro (82 M) | 자연스러운 음성 생성, 음성 클로닝 및 감정 태그 지원 모델 다수. |
| LLM 및 번역 | Qwen3Chat (0.8‑4 B), FunctionGemma (270 M), MADLAD‑400 (3 B) | 로컬에서 언어 모델 실행; 400개 이상 언어 간 번역 가능. |
| 음성 → 음성 / 음성 에이전트 | PersonaPlex (7 B), VoiceChat (11 B) | 풀 듀플렉스 오디오 입력/출력 에이전트이며, 도구 호출 가능한 LLM도 실행 가능. |
| 강화 및 분리 | DeepFilterNet3 (2.1 M), Source‑Separation (HTDemucs/UMX), FlashSR (오디오 슈퍼리졸루션) | 노이즈 제거, 에코 제거, 음원 분리, 오디오 업샘플링. |
| 전환 감지 및 발화자 분리 | Wake‑word, VAD, Smart‑Turn, Speaker Diarisation | 사용자가 말을 시작하거나 중단했는지, 누구인지 감지. |
추가 방법
// Package.swift 에서
.package(url: "https://github.com/soniqo/speech-swift", branch: "main")
필요한 부분만 가져옵니다. 예:
import ParakeetStreamingASR // 스트리밍 ASR
import SpeechUI // 선택적 SwiftUI 헬퍼
간단한 코드 예제 – 버퍼 전사
import ParakeetStreamingASR
let model = try await ParakeetStreamingASRModel.fromPretrained()
let text = try model.transcribeAudio(audioSamples, sampleRate: 16_000)
print(text)
같은 모델은 실시간 스트리밍에도 사용 가능:
for await part in model.transcribeStream(audio: samples, sampleRate: 16_000) {
print(part.isFinal ? "FINAL: \(part.text)" : "… \(part.text)")
}
작은 SwiftUI 뷰(SpeechUI)를 사용하면 약 10줄로 음성 입력 UI를 앱에 쉽게 추가할 수 있습니다.
에코시스템 및 커뮤니티
- 문서 – 완전한 가이드는 https://soniqo.audio (모델별 페이지, 벤치마크 표, 배포 팁).
- 사전 학습 모델 – Hugging Face의
aufklarer조직에서 호스팅. - 블로그 및 Discord – 성능 팁, 새로운 모델 출시 소식 정기 게시 및 지원용 Discord 서버.
- Homebrew – 명령줄 도구는
brew install speech로 설치 가능. - 검증된 하류 프로젝트 – 16개의 공개 리포지토리(예: AnythingLLM, Voicey, DexDictate)가 이미 Speech Swift에 의존.
일반적인 사용 사례
- 네트워크 호출 없이 완전히 디바이스 내에서 작동하는 음성 어시스턴트.
- 기자, 팟캐스트 제작자, 접근성 도구용 전사 앱.
- 팟캐스트 내레이션, 오디오북, 게임 내 NPC 음성 등 오디오 생성.
- 저지연 음성 → 음성 번역을 포함한 실시간 커뮤니케이션.
- 노이즈 제거, 에코 제거, 소스 분리 등의 오디오 후처리.
성능 iPhone 16 Pro, Core ML 환경에서의 벤치마크 결과, 스트리밍 음성 입력의 실시간 요인은 최소 0.04 RTF, 고품질 TTS는 0.08 RTF까지 가능하여, 모델이 음성 녹음보다 빠르게 처리됨을 의미.
라이선스 대부분의 모델은 허용성 있는 라이선스(Apache‑2.0, MIT) 또는 비상업 연구용 라이선스로 공개. Swift 패키지 자체는 MIT 라이선스로 오픈소스.
결론 – Speech Swift는 최신 음성 AI 기능을 디바이스 내에 유지하면서도 포괄적이고 프로덕션 준비 완료된 도구 상자로, 개인정보 중심 앱에 이상적인 선택입니다. 고품질 음성 인식, 합성, 번역, 음성 에이전트 기능이 필요한 개발자에게 완벽한 솔루션입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트