moonshine-ai/moonshine
Very low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces
What it solves
Moonshine Voiceは、開発者が完全にデバイス上で動作するリアルタイム音声エージェントおよびアプリケーションを構築するためのツールキットを提供します。クラウドAPI、アカウント、またはAPIキーを必要とせず、プライバシーとリアルタイムの音声インタラクションのための低遅延を実現します。
How it works
このツールキットは、スクラッチからトレーニングされた音声文字起こしモデルを使用します。Whisper Large V3を上回る高精度モデルから、超小型の1MBモデルまで幅広く用意されています。ユーザーが話している最中に音声を処理することで、遅延を最小限に抑える、ライブストリーミング向けに設計されています。
Who it’s for
Python, JavaScript/WASM, iOS, Android, macOS, Linux, Windows, および Raspberry Piを含む、幅広いプラットフォーム向けに音声機能アプリケーションを構築する開発者。
Highlights
- デバイス上での実行により、スピードとプライバシーを確保。
- 低遅延ストリーミングの最適化。
- 高性能モデルから1MBの超小型モデルまで、スケーラブルなモデルサイズ。
- モバイル、デスクトップ、および組み込みシステムにわたる幅広いクロスプラットフォーム対応。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト