wenet-e2e/wenet

Production First and Production Ready End-to-End Speech Recognition Toolkit

解决的问题

WeNet 是一个面向生产的端到端语音识别工具包。它旨在通过提供准确、轻量且专为实际生产环境设计的全栈解决方案,来弥合研究与部署之间的差距。

工作原理

WeNet 为流式和非流式语音识别提供框架。它支持多种模型用于英语和中文转录,例如 Paraformer、FireRed 和 Whisper (large-v3 和 large-v3-turbo)。该系统包含一个用于快速转录的 Python 包和一个用于部署的独立运行时,可以针对 x86 平台进行构建以优化性能。

适用对象

需要在生产环境中实现高精度语音转文本系统的开发人员和工程师,以及想要构建和训练端到端语音识别模型的研究人员。

亮点

  • 面向生产:专为生产环境设计,提供全栈解决方案。
  • SOTA 结果:在各种公开语音数据集上达到最先进(state-of-the-art)的水平。
  • 安装简便:提供用于快速入门的 Python 包,或用于训练和部署的完整安装包。
  • 广泛的硬件支持:支持 CUDA 和 Ascend NPU 进行加速。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目