moonshine-ai/moonshine
Very low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces
What it solves
Moonshine Voice は、リアルタイム音声エージェントやアプリケーションを開発する開発者向けに設計されています。従来の音声認識(STT)モデル(例:OpenAI の Whisper)は、入力ウィンドウが大きく、ストリーミング音声のキャッシュがないため、遅延が大きくリソース効率が悪いという課題があります。Moonshine は高速でプライベート、かつデバイス上で動作するソリューションを提供し、クラウド API や外部アカウントを必要とせずに応答性の高いライブ音声インターフェースを実現します。
How it works
Moonshine は、OnnxRuntime を利用したポータブルな C++ コアライブラリを使用し、さまざまなプラットフォームで高性能を発揮します。柔軟な入力ウィンドウとストリーミング用キャッシュを備えた、ゼロから訓練されたモデル群を提供し、ユーザーが話すたびに音声をインクリメンタルに処理できます。このツールキットは、マイク入力、音声活動検出、音声認識、話者識別、インテント認識といった音声インターフェースの複数段階を単一ライブラリに統合し、テキスト‑トゥ‑スピーチ(TTS)や対話エージェント向けのハイレベル API も提供します。
Who it’s for
Python、iOS、Android、macOS、Linux、Windows、Raspberry Pi だけでなく、マイコンやウェアラブルデバイスまで、幅広いプラットフォームで音声駆動アプリケーションを構築したい開発者向けです。
Highlights
- Low Latency: キャッシュと柔軟な入力ウィンドウでライブストリーミングを最適化し、200 ms 未満の応答性を実現。
- On-Device Processing: 完全にローカルで実行され、プライバシーと速度を確保。API キーやクレジットカードは不要です。
- High Accuracy: 英語向け Medium Streaming モデルは、WER(単語誤り率)で Whisper Large v3 を上回り、パラメータは 250 M(1.5 B と比較して大幅に少ない)です。
- C++ Core: 単一のポータブルコアにより、モバイル、デスクトップ、IoT デバイスで同一ライブラリが動作します。
- Multilingual Support: 英語、スペイン語、中文、日語、韓国語、ベトナム語、ウクライナ語、アラビア語など、複数言語向けの専門モデルを提供。
- Comprehensive Toolkit: 転写、TTS、音声クローン、インテント認識の組み込みサポートを含みます。