yeyupiaoling/MASR

Pytorch实现的流式与非流式的自动语音识别框架,同时兼容在线和离线识别,目前支持Conformer、Squeezeformer、DeepSpeech2模型,支持多种数据增强方法。

解决的问题

MASR(Magical Automatic Speech Recognition)是一个基于 PyTorch 的框架,旨在使自动语音识别(ASR)变得简单且实用。它提供了一个统一的系统,用于将语音转换为文本,支持跨多种语言和平台的实时(流式)和批量(非流式)处理。

工作原理

该框架实现了从音频预处理到最终文本输出的完整 ASR 流水线:

  • 模型:支持多种架构,包括 Conformer、Squeezeformer、Efficient Conformer 和 DeepSpeech2。
  • 预处理:使用 fbank 和 mfcc 等方法处理音频,利用 kaldi_native_fbank 库以提升速度和跨平台兼容性。
  • 解码:采用多种解码策略,如 CTC 贪心搜索、CTC 前缀束搜索、CTC 束搜索和注意力重评分。
  • 分词:使用 sentencepiece 进行分词,简化多语言处理,并支持中英文混合训练。
  • 数据增强:为提升鲁棒性,包含噪声、混响、速度、音量、重采样、位移增强,以及 SpecAugment 和 SpecSubAugment。

适用人群

MASR 适用于需要在服务器、Nvidia Jetson 设备上运行,甚至未来可部署到移动设备(Android)的可部署 ASR 系统的开发者和研究人员。

主要亮点

  • 灵活的推理:支持短音频、长音频、流式推理以及基于说话人分离的推理。
  • 多语言支持:可处理普通话、英语、粤语和维吾尔语,包括中英文混合模型。
  • 跨平台兼容:支持 Windows、Linux 和 macOS。
  • 全面的工具链:内置脚本用于数据准备、合成语音生成、模型训练、评估和模型导出。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目