moonshine: 실시간 대화형 에이전트를 위한 저지연 온디바이스 음성 툴킷

moonshine: 실시간 대화형 에이전트를 위한 저지연 온디바이스 음성 툴킷

해결하는 문제

Moonshine Voice는 실시간 음성 에이전트 및 애플리케이션을 구축하는 개발자를 위해 설계되었습니다. 이는 OpenAI의 Whisper와 같은 기존의 음성-텍스트 변환(STT) 모델이 흔히 큰 입력 윈도우를 필요로 하고 스트리밍 오디오를 위한 캐싱 기능이 부족하여 발생하는 높은 지연 시간과 리소스 비효율성을 해결합니다. Moonshine은 클라우드 API나 외부 계정이 필요하지 않은, 응답성이 뛰어난 라이브 음성 인터페이스를 가능하게 하는 빠르고 프라이빗한 온디바이스 솔루션을 제공합니다.

작동 방식

Moonshine은 다양한 플랫폼에서 높은 성능을 발휘할 수 있도록 OnnxRuntime 기반의 휴대 가능한 C++ 코어 라이브러리를 사용합니다. 유연한 입력 윈도우와 스트리밍을 위한 캐싱 기능을 갖추고 처음부터 학습된 모델 제품군을 특징으로 하며, 이를 통해 모델이 사용자가 말하는 동안 오디오를 점진적으로 처리할 수 있습니다. 이 툴킷은 마이크 캡처, 음성 활동 감지(VAD), 음성-텍스트 변환(STT), 화자 식별, 의도 인식 등 음성 인터페이스의 여러 단계를 하나의 라이브러리로 통합합니다. 또한 텍스트-음성 변환(TTS) 및 대화형 에이전트를 위한 고수준 API도 제공합니다.

대상 사용자

Python, iOS, Android, MacOS, Linux, Windows, Raspberry Pi, 그리고 마이크로컨트롤러나 웨어러블까지 포함한 광범위한 플랫폼에서 음성 기반 애플리케이션을 구축하는 개발자.

주요 특징

  • 저지연: 캐싱과 유연한 입력 윈도우를 통해 라이브 스트리밍에 최적화되어 200ms 미만의 응답성을 보장합니다.
  • 온디바이스 처리: 개인정보 보호와 속도를 위해 완전히 로컬에서 실행되므로 API 키나 신용카드가 필요하지 않습니다.
  • 높은 정확도: 영어의 경우 Medium Streaming 모델이 Whisper Large v3보다 훨씬 적은 파라미터(250M vs 1.5B)를 사용하면서도 단어 오류율(WER) 측면에서 더 뛰어난 성능을 보입니다.
  • C++ 코어: 단일 휴대 가능한 코어를 통해 동일한 라이브러리를 모바일, 데스크톱, IoT 기기에서 실행할 수 있습니다.
  • 다국어 지원: 영어, 스페인어, 중국어, 일본어, 한국어, 베트남어, 우크라이나어, 아랍어를 포함한 여러 언어에 대한 특화된 모델을 제공합니다.
  • 종합 툴킷: 전사(transcription), TTS, 음성 복제(voice cloning), 의도 인식을 위한 내장 지원을 포함합니다.

Sources