Picovoice/cheetah

On-device streaming speech-to-text engine powered by deep learning

What it solves

Cheetah는 디바이스에서 실행되는 스트리밍 음성-텍스트 엔진으로, 개발자가 실시간으로 오디오를 텍스트로 변환하면서 모든 음성 처리를 로컬 디바이스에서 수행해 프라이버시와 효율성을 보장합니다.

How it works

크로스 플랫폼 SDK로 동작하며 오디오 프레임을 실시간으로 처리합니다. 개발자는 제공된 AccessKey로 인증하고 엔진을 애플리케이션에 통합합니다. 엔진은 오디오 스트림을 처리하고 청취 중에 부분 전사를 제공하며, 엔드포인트(음성 구간의 끝)를 감지하면 최종 전사를 생성합니다.

Who it’s for

데스크톱(Windows, macOS, Linux), 모바일(iOS, Android), 웹(Chrome, Safari, Firefox, Edge), 임베디드 디바이스(Raspberry Pi)용 애플리케이션을 개발하는 개발자 중 고성능, 프라이버시 보호, 디바이스 내 전사가 필요한 경우에 적합합니다.

Highlights

  • Privacy-First: 모든 음성 처리가 디바이스 로컬에서 실행됩니다.
  • Broad Platform Support: 다양한 OS, 브라우저 및 하드웨어(Raspberry Pi 포함)와 호환됩니다.
  • Multi-Language Support: 영어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 스페인어를 지원합니다.
  • Resource Efficient: 컴팩트하고 계산 효율이 높아 디바이스 배포에 최적화되었습니다.