Uberi/speech_recognition
Speech recognition module for Python, supporting several engines and APIs, online and offline.
解決的問題
此函式庫為在 Python 中執行語音辨識提供了一個統一的介面,允許開發人員在不同的語音轉文字引擎與 API 之間輕鬆切換,而無需重寫核心邏輯。它簡化了從麥克風或檔案擷取音訊並將其轉換為文字的過程,同時支援線上雲端服務與離線本地引擎。
工作原理
此函式庫充當多個語音辨識後端的封裝器。它提供了一套一致的工具來處理音訊輸入(透過 PyAudio 處理麥克風),然後將該音訊路由到選定的辨識引擎。支援的後端包括:
- 離線引擎: CMU Sphinx、Vosk 以及 OpenAI Whisper。
- 線上 API: Google Speech Recognition、Google Cloud Speech、Wit.ai、Microsoft Azure Speech、Houndify、IBM Speech to Text、OpenAI Transcription API、Groq Whisper API 以及 Cohere Transcribe API。
它還包含用於校準環境噪音和管理音訊數據編碼(例如使用 FLAC)的工具函數。
適用對象
正在構建語音控制應用程式、逐字稿工具,或任何需要使用各種可用 AI 模型與服務將語音音訊轉換為文字的軟體的開發人員。
亮點
- 多引擎支援: 與廣泛的本地及雲端語音轉文字提供商相容。
- 線上與離線: 透過 Sphinx、Vosk 或 Whisper 支援完全離線的辨識,以滿足隱私或低延遲需求。
- 靈活的輸入: 可以直接從麥克風或現有的音訊檔案處理音訊。
- 環境噪音處理: 包含用於校準能量閾值以更好地處理背景噪音的功能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案