flashlight/wav2letter

Facebook AI Research's Automatic Speech Recognition Toolkit

解决的问题

wav2letter++ 旨在为端到端自动语音识别 (ASR) 提供高性能框架,能够复现各种研究论文,并使用预训练模型将语音转换为文本。

工作原理

该项目提供了一套与 Flashlight 机器学习库集成的方案和预训练模型。它支持多种 ASR 架构,包括流式 ConvNets、具有时间深度分离卷积的 sequence-to-sequence 模型以及无词典语音识别。

适用对象

主要面向从事语音识别工作的研究人员和开发人员,特别是那些寻求复现学术成果或实现最先进 ASR 架构的人员。

亮点

  • 支持多种基于研究的 ASR 架构,包括 ConvNets 和 Seq2Seq。
  • 提供用于语音识别的半监督学习和自训练方案。
  • 包含可直接使用的预训练模型。
  • 与 Flashlight 库集成,实现高性能执行。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目