FluidInference/FluidAudio
Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.
What it solves
FluidAudio는 Apple 기기에서 완전한 로컬, 저지연 오디오 AI를 가능하게 하는 Swift SDK입니다. 클라우드 기반 오디오 프로세싱에 의존하는 문제를 해결하기 위해 추론을 Apple Neural Engine (ANE)으로 오체하여 메모리 사용량을 줄이고, 전력 소비를 낮추며, 사용자 프라이버시를 유지하면서 속도를 높입니다.
How it works
이 SDK는 CPU와 GPU/MPS를 완전히 피하고 ANE에서 직접 실행되는 최적화된 오픈 소스 모델 (MIT/Apache 2.0)을 통합합니다. 여러 오디오 작업에 대해 통합된 인터페이스를 제공합니다:
- Automatic Speech Recognition (ASR): Parakeet TDT 및 SenseVoice와 같은 모델을 사용하여 여러 언어에 걸쳐 배치 및 스트리밍 전사(transcription)를 지원합니다.
- Text-to-Speech (TTS): Kokoro 및 PocketTTS를 통한 음성 복제(voice cloning) 기능이 포함된 병렬 합성 및 스트리밍 TTS를 제공합니다.
- Speaker Diarization: 오디오 스트림에서 서로 다른 화자를 분리하고 식별하기 위한 온라인 및 오프라인 파이프라인을 제공합니다.
- Voice Activity Detection (VAD): Silero 모델을 사용하여 음성이 발생하는 시점을 감지합니다.
Who it’s for
회의 보조 도구, 받아쓰기 도구, 음성 제어 인터페이스와 같이 프라이버시를 우선시하는 오프라인 오디오 애플리케이션을 구축하고자 하는 macOS 및 iOS 개발자를 위해 설계되었습니다.
Highlights
Apple Neural Engine Optimization: ANE에서 추론을 실행하여 최대 성능과 최소 전력 소비를 실현합니다.
Comprehensive Audio Suite: ASR, TTS, 화자 분리(speaker diarization), VAD를 하나의 SDK에 포함합니다.
Multilingual Support: 영어, 유럽 언어, 일본어, 중국어(Mandarin Chinese)를 포함한 수십 개의 언어에 걸친 전사 및 합성을 지원합니다.
Local-First Architecture: 완전한 오프라인 프로세싱은 데이터 프라이버시를 보장하고 클라우드 지연 시간을 제거합니다.
Extensible Integration: React Native/Expo 및 Rust/Tauri를 위한 공식 래퍼(wrapper)와 함께 Swift package로 제공됩니다.