moonshine-ai/moonshine
Very low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces
What it solves
Moonshine Voice 是為開發即時語音代理與應用程式的開發者而設計。它解決了傳統語音轉文字(STT)模型(如 OpenAI 的 Whisper)高延遲與資源低效的問題,這類模型通常需要大型輸入視窗且缺乏串流音訊的快取機制。Moonshine 提供快速、私密、在裝置上執行的解決方案,讓使用者能在不依賴雲端 API 或外部帳號的情況下,擁有即時回應的語音介面。
How it works
Moonshine 使用由 OnnxRuntime 支援的可移植 C++ 核心函式庫,以在各種平台上提供高效能。它包含一系列從頭訓練、具彈性輸入視窗與串流快取功能的模型,讓模型能在使用者說話時逐段處理音訊。此工具組將語音介面的多個階段——麥克風擷取、語音活動偵測、語音轉文字、說話者辨識與意圖辨識——整合於單一函式庫,並提供高階 API 供文字轉語音(TTS)與對話代理使用。
Who it’s for
適用於開發跨平台語音驅動應用程式的開發者,支援 Python、iOS、Android、macOS、Linux、Windows、Raspberry Pi,甚至微控制器或穿戴式裝置。
Highlights
- Low Latency: 最佳化即時串流,具快取與彈性輸入視窗,確保回應時間低於 200 ms。
- On-Device Processing: 完全在本機執行,保障隱私與速度,免除 API 金鑰或信用卡需求。
- High Accuracy: 英文的 Medium Streaming 模型在字錯誤率(WER)上優於 Whisper Large v3,且參數量僅 250 M(相較 1.5 B)。
- C++ Core: 單一可移植核心讓相同函式庫可在行動、桌面與 IoT 裝置上運行。
- Multilingual Support: 提供多語言專屬模型,包含英語、西班牙語、中文、日語、韓語、越南語、烏克蘭語與阿拉伯語。
- Comprehensive Toolkit: 內建支援轉錄、TTS、語音克隆與意圖辨識。