flashlight/wav2letter
Facebook AI Research's Automatic Speech Recognition Toolkit
解决的问题
wav2letter++ 旨在为端到端自动语音识别 (ASR) 提供高性能框架,能够复现各种研究论文,并使用预训练模型将语音转换为文本。
工作原理
该项目提供了一套与 Flashlight 机器学习库集成的方案和预训练模型。它支持多种 ASR 架构,包括流式 ConvNets、具有时间深度分离卷积的 sequence-to-sequence 模型以及无词典语音识别。
适用对象
主要面向从事语音识别工作的研究人员和开发人员,特别是那些寻求复现学术成果或实现最先进 ASR 架构的人员。
亮点
- 支持多种基于研究的 ASR 架构,包括 ConvNets 和 Seq2Seq。
- 提供用于语音识别的半监督学习和自训练方案。
- 包含可直接使用的预训练模型。
- 与 Flashlight 库集成,实现高性能执行。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目