moonshine-ai/moonshine

Very low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces

What it solves

Moonshine Voice は、リアルタイム音声エージェントやアプリケーションを開発する開発者向けに設計されています。従来の音声認識(STT)モデル(例:OpenAI の Whisper)は、入力ウィンドウが大きく、ストリーミング音声のキャッシュがないため、遅延が大きくリソース効率が悪いという課題があります。Moonshine は高速でプライベート、かつデバイス上で動作するソリューションを提供し、クラウド API や外部アカウントを必要とせずに応答性の高いライブ音声インターフェースを実現します。

How it works

Moonshine は、OnnxRuntime を利用したポータブルな C++ コアライブラリを使用し、さまざまなプラットフォームで高性能を発揮します。柔軟な入力ウィンドウとストリーミング用キャッシュを備えた、ゼロから訓練されたモデル群を提供し、ユーザーが話すたびに音声をインクリメンタルに処理できます。このツールキットは、マイク入力、音声活動検出、音声認識、話者識別、インテント認識といった音声インターフェースの複数段階を単一ライブラリに統合し、テキスト‑トゥ‑スピーチ(TTS)や対話エージェント向けのハイレベル API も提供します。

Who it’s for

Python、iOS、Android、macOS、Linux、Windows、Raspberry Pi だけでなく、マイコンやウェアラブルデバイスまで、幅広いプラットフォームで音声駆動アプリケーションを構築したい開発者向けです。

Highlights

  • Low Latency: キャッシュと柔軟な入力ウィンドウでライブストリーミングを最適化し、200 ms 未満の応答性を実現。
  • On-Device Processing: 完全にローカルで実行され、プライバシーと速度を確保。API キーやクレジットカードは不要です。
  • High Accuracy: 英語向け Medium Streaming モデルは、WER(単語誤り率)で Whisper Large v3 を上回り、パラメータは 250 M(1.5 B と比較して大幅に少ない)です。
  • C++ Core: 単一のポータブルコアにより、モバイル、デスクトップ、IoT デバイスで同一ライブラリが動作します。
  • Multilingual Support: 英語、スペイン語、中文、日語、韓国語、ベトナム語、ウクライナ語、アラビア語など、複数言語向けの専門モデルを提供。
  • Comprehensive Toolkit: 転写、TTS、音声クローン、インテント認識の組み込みサポートを含みます。