alphacep/vosk-api

Offline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node

解決的問題

它提供了一個離線開源語音辨識工具包,允許使用者在無需網際網路連接的情況下將語音轉換為文本,支援 20 多種語言和方言。

工作原理

Vosk 使用小型且高效的模型(約 50 MB),能夠實現大規模詞彙的連續轉錄。它提供用於零延遲響應的串流 API,並支援說話者辨識和可重新配置的詞彙表。

適用對象

構建聊天機器人、智慧家電和虛擬助理的開發人員,以及需要為電影製作字幕或為講座和訪談製作轉錄文本的人員。

亮點

  • 用於隱私保護和可靠性的離線功能。
  • 支援 20 多種語言和方言。
  • 輕量級模型 (50 MB),可在從 Raspberry Pi 到大型集群的各種裝置上執行。
  • 提供包括 Python, Java, Node.JS, C#, C++, Rust 和 Go 在內的多種語言綁定。

相關

  • 專案
  • 專案
  • 專案
  • 專案