Picovoice/cheetah
On-device streaming speech-to-text engine powered by deep learning
What it solves
Cheetah はデバイス上で動作するストリーミング音声認識エンジンで、開発者がリアルタイムに音声をテキストに変換でき、音声処理をすべてローカルで行うためプライバシーと効率性が確保されます。
How it works
クロスプラットフォーム SDK として動作し、音声フレームをリアルタイムで処理します。開発者は提供された AccessKey で認証し、エンジンをアプリに組み込みます。エンジンは音声ストリームを処理し、聞き取りながら部分的な文字起こしを提供し、エンドポイント(音声セグメントの終了)が検出されると最終的な文字起こしを生成します。
Who it’s for
デスクトップ(Windows、macOS、Linux)、モバイル(iOS、Android)、ウェブ(Chrome、Safari、Firefox、Edge)、組み込みデバイス(Raspberry Pi)向けに、高性能でプライベートなオンデバイス文字起こしが必要な開発者向けです。
Highlights
- Privacy-First: すべての音声処理はデバイス上でローカルに実行されます。
- Broad Platform Support: 幅広い OS、ブラウザ、ハードウェア(Raspberry Pi を含む)に対応。
- Multi-Language Support: 英語、フランス語、ドイツ語、イタリア語、ポルトガル語、スペイン語に対応。
- Resource Efficient: コンパクトで計算リソース効率が高く、オンデバイス展開に最適化されています。