alphacep/vosk-api

Offline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node

解决的问题

它提供了一个离线开源语音识别工具包,允许用户在无需互联网连接的情况下将语音转换为文本,支持 20 多种语言和方言。

工作原理

Vosk 使用小型且高效的模型(约 50 MB),能够实现大规模词汇的连续转录。它提供用于零延迟响应的流式 API,并支持说话人识别和可重新配置的词汇表。

适用对象

构建聊天机器人、智能家用电器和虚拟助手的开发人员,以及需要为电影制作字幕或为讲座和访谈制作转录文本的人员。

亮点

  • 用于隐私保护和可靠性的离线功能。
  • 支持 20 多种语言和方言。
  • 轻量级模型 (50 MB),可在从 Raspberry Pi 到大型集群的各种设备上运行。
  • 提供包括 Python, Java, Node.JS, C#, C++, Rust 和 Go 在内的多种语言绑定。

相关

  • 项目
  • 项目
  • 项目
  • 项目