wenet-e2e/wenet
Production First and Production Ready End-to-End Speech Recognition Toolkit
解决的问题
WeNet 是一个面向生产的端到端语音识别工具包。它旨在通过提供准确、轻量且专为实际生产环境设计的全栈解决方案,来弥合研究与部署之间的差距。
工作原理
WeNet 为流式和非流式语音识别提供框架。它支持多种模型用于英语和中文转录,例如 Paraformer、FireRed 和 Whisper (large-v3 和 large-v3-turbo)。该系统包含一个用于快速转录的 Python 包和一个用于部署的独立运行时,可以针对 x86 平台进行构建以优化性能。
适用对象
需要在生产环境中实现高精度语音转文本系统的开发人员和工程师,以及想要构建和训练端到端语音识别模型的研究人员。
亮点
- 面向生产:专为生产环境设计,提供全栈解决方案。
- SOTA 结果:在各种公开语音数据集上达到最先进(state-of-the-art)的水平。
- 安装简便:提供用于快速入门的 Python 包,或用于训练和部署的完整安装包。
- 广泛的硬件支持:支持 CUDA 和 Ascend NPU 进行加速。
相关
- 项目
- 项目
- 项目
- 项目
- 项目