wenet-e2e/wenet
Production First and Production Ready End-to-End Speech Recognition Toolkit
解決的問題
WeNet 是一個面向生產的端到端語音識別工具包。它旨在透過提供準確、輕量且專為實際生產環境設計的全棧解決方案,來彌合研究與部署之間的差距。
工作原理
WeNet 為串流和非串流語音識別提供框架。它支援多種模型用於英語和中文轉錄,例如 Paraformer、FireRed 和 Whisper (large-v3 和 large-v3-turbo)。該系統包含一個用於快速轉錄的 Python 套件和一個用於部署的獨立執行階段,可以針對 x86 平台進行建置以優化效能。
適用對象
需要在生產環境中實現高精度語音轉文字系統的開發人員和工程師,以及想要建置和訓練端到端語音識別模型的研究人員。
亮點
- 面向生產:專為生產環境設計,提供全棧解決方案。
- SOTA 結果:在各種公開語音數據集上達到最先進(state-of-the-art)的水平。
- 安裝簡便:提供用於快速入門的 Python 套件,或用於訓練和部署的完整安裝。
- 廣泛的硬體支援:支援 CUDA 和 Ascend NPU 進行加速。
相關
- 專案
- 專案
- 專案
- 專案
- 專案