FluidInference/FluidAudio
Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.
해결하는 문제
FluidAudio는 개발자가 고성능의 완전히 로컬 오디오 AI 기능을 Apple 기기(macOS 및 iOS)에 통합할 수 있게 해주는 Swift SDK입니다. 클라우드 기반 오디오 처리의 필요성을 제거하고, 추론을 Apple Neural Engine (ANE)으로 오프로드하여 개인정보를 보호하고 지연 시간을 줄입니다.
작동 방식
이 SDK는 ANE에서 직접 실행되도록 최적화된 CoreML 모델 세트를 제공하여, CPU와 GPU 사용을 피하고 전력 소비와 메모리 사용량을 최소화합니다. Swift Package Manager 또는 React Native 및 Rust/Tauri용 공식 래퍼를 통해 프로젝트에 추가할 수 있는 다양한 오디오 작업용 오픈 소스 모델을 통합합니다.
대상 사용자
받아쓰기 도구, 회의 어시스턴트, 음성 제어 인터페이스 등 실시간 또는 배치 오디오 처리가 필요한 앱을 구축하는 Apple 플랫폼 개발자를 위해 설계되었습니다.
주요 기능
- 자동 음성 인식 (ASR): 유럽 언어, 일본어, 만다린어를 포함한 여러 언어에 대한 배치 및 스트리밍 전사를 지원합니다.
- 텍스트 음성 변환 (TTS): SSML을 사용한 병렬 합성 및 음성 복제를 지원하는 스트리밍 TTS를 특징으로 합니다.
- 화자 분리: 오디오 스트림에서 다른 화자를 분리하고 식별하기 위한 온라인(실시간) 및 오프라인(배치) 파이프라인을 제공합니다.
- 음성 활동 감지 (VAD): Silero 모델을 사용하여 음성이 발생하는 시기를 감지합니다.
- Apple Neural Engine 최적화: 최고의 성능과 최소의 전력 소모를 보장하기 위해 ANE에 맞게 특별히 조정되었습니다.
- 역 텍스트 정규화 (ITN): 구어 형식 텍스트(예: "two hundred")를 문어 형식(예: "200")으로 변환하는 도구가 포함되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트