Picovoice/cheetah
On-device streaming speech-to-text engine powered by deep learning
What it solves
Cheetah 是一個在裝置上執行的串流語音轉文字引擎,讓開發者能即時將音訊轉寫成文字,同時將所有語音處理保留在本機裝置上,以確保隱私與效能。
How it works
它作為跨平台 SDK,實時處理音訊幀。開發者使用提供的 AccessKey 進行驗證,將引擎整合到自己的應用程式中。引擎會即時處理音訊串流,並在偵測到語音段落結束點時產生最終稿,同時在過程中提供部分轉錄結果。
Who it’s for
適用於開發桌面應用(Windows、macOS、Linux)、行動裝置(iOS、Android)、網頁(Chrome、Safari、Firefox、Edge)以及嵌入式設備(Raspberry Pi)的開發者,需求是高效能、私密、在裝置上完成的轉錄。
Highlights
- Privacy-First: 所有語音處理皆在裝置本地執行。
- Broad Platform Support: 相容於多種作業系統、瀏覽器與硬體,包括 Raspberry Pi。
- Multi-Language Support: 支援英語、法語、德語、義大利語、葡萄牙語與西班牙語。
- Resource Efficient: 設計緊湊且計算資源需求低,適合在裝置上部署。