Picovoice/cheetah
On-device streaming speech-to-text engine powered by deep learning
What it solves
Cheetah 是一款在设备上运行的流式语音转文字引擎,允许开发者实时将音频转写为文本,同时将所有语音处理保留在本地设备上,以确保隐私和效率。
How it works
它作为跨平台 SDK,实时处理音频帧。开发者使用提供的 AccessKey 进行身份验证,将引擎集成到自己的应用中。引擎会处理音频流并在监听时提供部分转录,当检测到端点(语音段落结束)时生成最终转录稿。
Who it’s for
适用于为桌面(Windows、macOS、Linux)、移动端(iOS、Android)、网页(Chrome、Safari、Firefox、Edge)以及嵌入式设备(Raspberry Pi)构建应用的开发者,需求是高性能、私密、在设备上完成的转录。
Highlights
- Privacy-First: 所有语音处理均在设备本地运行。
- Broad Platform Support: 兼容多种操作系统、浏览器和硬件,包括 Raspberry Pi。
- Multi-Language Support: 支持英语、法语、德语、意大利语、葡萄牙语和西班牙语。
- Resource Efficient: 设计紧凑且计算资源高效,适合在设备上部署。