alphacep/vosk-api
Offline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node
解決的問題
它提供了一個離線開源語音辨識工具包,允許使用者在無需網際網路連接的情況下將語音轉換為文本,支援 20 多種語言和方言。
工作原理
Vosk 使用小型且高效的模型(約 50 MB),能夠實現大規模詞彙的連續轉錄。它提供用於零延遲響應的串流 API,並支援說話者辨識和可重新配置的詞彙表。
適用對象
構建聊天機器人、智慧家電和虛擬助理的開發人員,以及需要為電影製作字幕或為講座和訪談製作轉錄文本的人員。
亮點
- 用於隱私保護和可靠性的離線功能。
- 支援 20 多種語言和方言。
- 輕量級模型 (50 MB),可在從 Raspberry Pi 到大型集群的各種裝置上執行。
- 提供包括 Python, Java, Node.JS, C#, C++, Rust 和 Go 在內的多種語言綁定。
相關
- 專案
- 專案
- 專案
- 專案