alphacep/vosk-api
Offline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node
解决的问题
它提供了一个离线开源语音识别工具包,允许用户在无需互联网连接的情况下将语音转换为文本,支持 20 多种语言和方言。
工作原理
Vosk 使用小型且高效的模型(约 50 MB),能够实现大规模词汇的连续转录。它提供用于零延迟响应的流式 API,并支持说话人识别和可重新配置的词汇表。
适用对象
构建聊天机器人、智能家用电器和虚拟助手的开发人员,以及需要为电影制作字幕或为讲座和访谈制作转录文本的人员。
亮点
- 用于隐私保护和可靠性的离线功能。
- 支持 20 多种语言和方言。
- 轻量级模型 (50 MB),可在从 Raspberry Pi 到大型集群的各种设备上运行。
- 提供包括 Python, Java, Node.JS, C#, C++, Rust 和 Go 在内的多种语言绑定。
相关
- 项目
- 项目
- 项目
- 项目