Picovoice/cheetah

On-device streaming speech-to-text engine powered by deep learning

What it solves

Cheetah 是一個在裝置上執行的串流語音轉文字引擎,讓開發者能即時將音訊轉寫成文字,同時將所有語音處理保留在本機裝置上,以確保隱私與效能。

How it works

它作為跨平台 SDK,實時處理音訊幀。開發者使用提供的 AccessKey 進行驗證,將引擎整合到自己的應用程式中。引擎會即時處理音訊串流,並在偵測到語音段落結束點時產生最終稿,同時在過程中提供部分轉錄結果。

Who it’s for

適用於開發桌面應用(Windows、macOS、Linux)、行動裝置(iOS、Android)、網頁(Chrome、Safari、Firefox、Edge)以及嵌入式設備(Raspberry Pi)的開發者,需求是高效能、私密、在裝置上完成的轉錄。

Highlights

  • Privacy-First: 所有語音處理皆在裝置本地執行。
  • Broad Platform Support: 相容於多種作業系統、瀏覽器與硬體,包括 Raspberry Pi。
  • Multi-Language Support: 支援英語、法語、德語、義大利語、葡萄牙語與西班牙語。
  • Resource Efficient: 設計緊湊且計算資源需求低,適合在裝置上部署。