moonshine-ai/moonshine
Very low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces
What it solves
Moonshine Voice는 실시간 음성 에이전트와 애플리케이션을 개발하는 개발자를 위해 설계되었습니다. OpenAI의 Whisper와 같은 기존 음성‑텍스트(STT) 모델은 큰 입력 윈도우가 필요하고 스트리밍 오디오에 대한 캐싱이 없어 높은 지연 시간과 비효율적인 리소스 사용이라는 문제를 가지고 있습니다. Moonshine은 빠르고 프라이버시를 보장하며 디바이스에서 동작하는 솔루션을 제공하여 클라우드 API나 외부 계정 없이도 반응성이 뛰어난 실시간 음성 인터페이스를 구현할 수 있게 합니다.
How it works
Moonshine은 OnnxRuntime 기반의 포터블 C++ 코어 라이브러리를 사용해 다양한 플랫폼에서 높은 성능을 발휘합니다. 유연한 입력 윈도우와 스트리밍 캐시를 지원하도록 처음부터 학습된 모델군을 제공하여 사용자가 말할 때마다 오디오를 점진적으로 처리할 수 있습니다. 이 툴킷은 마이크 캡처, 음성 활동 감지, 음성‑텍스트 변환, 화자 식별, 인텐트 인식 등 음성 인터페이스의 여러 단계를 하나의 라이브러리로 통합하고, 텍스트‑투‑스피치(TTS)와 대화형 에이전트를 위한 고수준 API도 제공합니다.
Who it’s for
Python, iOS, Android, macOS, Linux, Windows, Raspberry Pi는 물론 마이크로컨트롤러나 웨어러블 디바이스까지, 다양한 플랫폼에서 음성 기반 애플리케이션을 구축하고자 하는 개발자를 위한 솔루션입니다.
Highlights
- Low Latency: 캐시와 유연한 입력 윈도우를 활용해 실시간 스트리밍을 최적화하고 200 ms 이하의 응답성을 보장합니다.
- On-Device Processing: 완전히 로컬에서 실행되어 프라이버시와 속도를 확보하며, API 키나 신용카드가 필요 없습니다.
- High Accuracy: 영어용 Medium Streaming 모델은 WER(Word Error Rate)에서 Whisper Large v3보다 우수하며 파라미터 수는 250 M(1.5 B 대비 크게 감소)입니다.
- C++ Core: 단일 포터블 코어 덕분에 모바일, 데스크톱, IoT 디바이스 모두에서 동일한 라이브러리를 사용할 수 있습니다.
- Multilingual Support: 영어, 스페인어, 중국어, 일본어, 한국어, 베트남어, 우크라이나어, 아랍어 등 다수 언어에 특화된 모델을 제공합니다.
- Comprehensive Toolkit: 전사, TTS, 음성 클로닝, 인텐트 인식을 포함한 내장 지원을 제공합니다.