Picovoice/cheetah

On-device streaming speech-to-text engine powered by deep learning

What it solves

Cheetah はデバイス上で動作するストリーミング音声認識エンジンで、開発者がリアルタイムに音声をテキストに変換でき、音声処理をすべてローカルで行うためプライバシーと効率性が確保されます。

How it works

クロスプラットフォーム SDK として動作し、音声フレームをリアルタイムで処理します。開発者は提供された AccessKey で認証し、エンジンをアプリに組み込みます。エンジンは音声ストリームを処理し、聞き取りながら部分的な文字起こしを提供し、エンドポイント(音声セグメントの終了)が検出されると最終的な文字起こしを生成します。

Who it’s for

デスクトップ(Windows、macOS、Linux)、モバイル(iOS、Android)、ウェブ(Chrome、Safari、Firefox、Edge)、組み込みデバイス(Raspberry Pi)向けに、高性能でプライベートなオンデバイス文字起こしが必要な開発者向けです。

Highlights

  • Privacy-First: すべての音声処理はデバイス上でローカルに実行されます。
  • Broad Platform Support: 幅広い OS、ブラウザ、ハードウェア(Raspberry Pi を含む)に対応。
  • Multi-Language Support: 英語、フランス語、ドイツ語、イタリア語、ポルトガル語、スペイン語に対応。
  • Resource Efficient: コンパクトで計算リソース効率が高く、オンデバイス展開に最適化されています。