moonshine: 适用于实时对话智能体的低延迟端侧语音工具包
moonshine: 适用于实时对话智能体的低延迟端侧语音工具包
它解决了什么问题
Moonshine Voice 是为构建实时语音智能体和应用程序的开发者设计的。它解决了像 OpenAI 的 Whisper 这样的传统语音转文本 (STT) 模型的高延迟和资源效率低下的问题,这些模型通常需要较大的输入窗口,并且缺乏针对流式音频的缓存机制。Moonshine 提供了一种快速、私密、端侧的解决方案,无需云端 API 或外部账户即可实现响应迅速的实时语音界面。
工作原理
Moonshine 使用由 OnnxRuntime 提供支持的便携式 C++ 核心库,以在各种平台上实现高性能。它拥有一系列从头开始训练的模型,具有灵活的输入窗口和流式传输缓存,允许模型在用户说话时增量处理音频。该工具包将语音界面的多个阶段——麦克风采集、语音活动检测、语音转文本、说话人识别和意图识别——集成到一个单一的库中。它还为文本转语音 (TTS) 和对话智能体提供了高级 API。
适用人群
在各种平台上构建语音驱动型应用程序的开发者,包括 Python, iOS, Android, MacOS, Linux, Windows, Raspberry Pi,甚至微控制器或可穿戴设备。
亮点
- 低延迟: 针对实时流式传输进行了优化,通过缓存和灵活的输入窗口确保响应时间低于 200ms。
- 端侧处理: 完全在本地运行以保证隐私和速度,无需 API 密钥或信用卡。
- 高准确度: 英语 Medium Streaming 模型在词错误率 (WER) 方面优于 Whisper Large v3,同时使用的参数量显著更少 (250M vs 1.5B)。
- C++ 核心: 单一的便携式核心允许同一个库在移动端、桌面端和 IoT 设备上运行。
- 多语言支持: 为多种语言提供专门的模型,包括英语、西班牙语、普通话、日语、韩语、越南语、乌克兰语和阿拉伯语。
- 全面的工具包: 包括对转录、TTS、语音克隆和意图识别的内置支持。
Sources
- undefinedmoonshine-ai/moonshine