openspeech-team/openspeech

Open-Source Toolkit for End-to-End Speech Recognition leveraging PyTorch-Lightning and Hydra.

解决的问题

OpenSpeech 是一个旨在简化端到端(E2E)自动语音识别(ASR)系统构建的框架。它取代了传统的“混合”ASR系统——这些系统需要为声学模型、语言模型和发音模型分别进行复杂训练——采用单一集成方法,显著减少训练和解码时间。

工作原理

基于 PyTorch-Lightning 和 Hydra 构建,OpenSpeech 提供了一个与硬件无关的 ASR 模型训练环境。用户无需复杂工程即可利用混合精度训练、多节点训练和 TPU 支持等高级功能。该框架包含 20 多个 ASR 模型论文的参考实现,支持常见的音频特征(如频谱图、梅尔频谱图、滤波器组、MFCC),以及 SpecAugment 等多种数据增强技术。

适用人群

专为研究人员、教育工作者和实践者设计,适合希望实验著名 ASR 模型,或使用提供的模块和英、中、韩语配方构建自定义语音识别器的人群。

主要亮点

  • 丰富的模型库:支持 20 多种 ASR 架构,包括 Conformer、Transformer、Jasper、QuartzNet 和 DeepSpeech2。
  • 硬件无关:通过 PyTorch-Lightning 无缝支持 GPU 和 TPU 训练。
  • 语言配方:包含 LibriSpeech(英语)、AISHELL-1(中文)和 KsponSpeech(韩语)的预配置配方。
  • 灵活配置:使用 Hydra 实现训练超参数的分层、动态配置管理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目