wenet-e2e/wenet

Production First and Production Ready End-to-End Speech Recognition Toolkit

解決的問題

WeNet 是一個面向生產的端到端語音識別工具包。它旨在透過提供準確、輕量且專為實際生產環境設計的全棧解決方案,來彌合研究與部署之間的差距。

工作原理

WeNet 為串流和非串流語音識別提供框架。它支援多種模型用於英語和中文轉錄,例如 Paraformer、FireRed 和 Whisper (large-v3 和 large-v3-turbo)。該系統包含一個用於快速轉錄的 Python 套件和一個用於部署的獨立執行階段,可以針對 x86 平台進行建置以優化效能。

適用對象

需要在生產環境中實現高精度語音轉文字系統的開發人員和工程師,以及想要建置和訓練端到端語音識別模型的研究人員。

亮點

  • 面向生產:專為生產環境設計,提供全棧解決方案。
  • SOTA 結果:在各種公開語音數據集上達到最先進(state-of-the-art)的水平。
  • 安裝簡便:提供用於快速入門的 Python 套件,或用於訓練和部署的完整安裝。
  • 廣泛的硬體支援:支援 CUDA 和 Ascend NPU 進行加速。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案