moonshine-ai/moonshine

Very low latency speech to text, intent recognition, and text to speech, for building voice agents and interfaces

What it solves

Moonshine Voice 旨在帮助开发实时语音代理和应用的开发者。它解决了传统语音转文字(STT)模型(如 OpenAI 的 Whisper)高延迟和资源低效的问题,这类模型通常需要大输入窗口且缺乏流式音频的缓存。Moonshine 提供快速、私密、在设备上运行的解决方案,使得无需云端 API 或外部账户即可实现响应迅速的实时语音交互。

How it works

Moonshine 使用由 OnnxRuntime 驱动的可移植 C++ 核心库,在各种平台上实现高性能。它包含一系列从头训练、具灵活输入窗口和流式缓存的模型,能够在用户说话时增量处理音频。该工具包将语音交互的多个阶段——麦克风采集、语音活动检测、语音转文字、说话人识别和意图识别——整合到单一库中,并提供高级 API 用于文字转语音(TTS)和对话代理。

Who it’s for

适用于构建跨平台语音驱动应用的开发者,支持 Python、iOS、Android、macOS、Linux、Windows、Raspberry Pi,甚至微控制器或可穿戴设备。

Highlights

  • Low Latency: 为实时流媒体优化,具缓存和灵活输入窗口,确保响应时间低于 200 ms。
  • On-Device Processing: 完全本地运行,保障隐私与速度,免除 API 密钥或信用卡需求。
  • High Accuracy: 英文的 Medium Streaming 模型在词错误率(WER)上优于 Whisper Large v3,且参数仅 250 M(相较 1.5 B)。
  • C++ Core: 单一可移植核心让同一库可在移动、桌面和 IoT 设备上运行。
  • Multilingual Support: 提供多语言专用模型,包括英语、西班牙语、中文、日语、韩语、越南语、乌克兰语和阿拉伯语。
  • Comprehensive Toolkit: 内置支持转录、TTS、语音克隆和意图识别。