moonshine: 適用於即時對話代理的低延遲裝置端語音工具包
moonshine: 適用於即時對話代理的低延遲裝置端語音工具包
它解決了什麼問題
Moonshine Voice 是專為開發即時語音代理和應用程式的開發者而設計的。它解決了傳統語音轉文字 (STT) 模型(例如 OpenAI 的 Whisper)的高延遲和資源效率低下的問題,這些模型通常需要較大的輸入窗口,且缺乏針對串流音訊的快取機制。Moonshine 提供了一個快速、私密且在裝置端運行的解決方案,讓使用者無需雲端 API 或外部帳戶即可實現響應迅速的即時語音介面。
運作原理
Moonshine 使用由 OnnxRuntime 提供支援的便攜式 C++ 核心函式庫,可在各種平台上實現高效能。它擁有一系列從頭開始訓練的模型,具備靈活的輸入窗口和串流快取功能,這使得模型能夠在使用者說話時增量式地處理音訊。該工具包將語音介面的多個階段——麥克風擷取、語音活動檢測 (VAD)、語音轉文字 (STT)、說話者識別和意圖識別——整合到單一函式庫中。它還為文字轉語音 (TTS) 和對話代理提供了高階 API。
對象是誰
開發各種平台上的語音驅動應用程式的開發者,包括 Python、iOS、Android、MacOS、Linux、Windows、Raspberry Pi,甚至是微控制器或穿戴式裝置。
重點特色
- 低延遲: 針對即時串流進行優化,透過快取和靈活的輸入窗口來確保延遲低於 200ms。
- 裝置端處理: 完全在本地運行,以確保隱私和速度,無需 API 金鑰或信用卡。
- 高準確度: 英文的 Medium Streaming 模型在字錯誤率 (WER) 方面優於 Whisper Large v3,同時使用的參數數量顯著較少 (250M vs 1.5B)。
- C++ 核心: 單一的便攜式核心讓同一個函式庫可以在行動裝置、桌面端和 IoT 裝置上運行。
- 多語言支持: 提供多種語言的專用模型,包括英文、西班牙文、中文、日文、韓文、越南文、烏克蘭文和阿拉伯文。
- 全方位工具包: 內建對逐字稿轉錄、TTS、語音複製和意圖識別的支持。
Sources
- undefinedmoonshine-ai/moonshine