flashlight/wav2letter
Facebook AI Research's Automatic Speech Recognition Toolkit
解決的問題
wav2letter++ 旨在為端到端自動語音識別 (ASR) 提供高性能框架,能夠復現各種研究論文,並使用預訓練模型將語音轉換為文本。
工作原理
該專案提供了一套與 Flashlight 機器學習函式庫集成的方案與預訓練模型。它支援多種 ASR 架構,包括串流 ConvNets、具有時間深度分離卷積的 sequence-to-sequence 模型以及無詞典語音識別。
適用對象
主要面向從事語音識別工作的研究人員與開發人員,特別是那些尋求復現學術成果或實現最先進 ASR 架構的人員。
亮點
- 支援多種基於研究的 ASR 架構,包括 ConvNets 與 Seq2Seq。
- 提供用於語音識別的半監督學習與自我訓練方案。
- 包含可直接使用的預訓練模型。
- 與 Flashlight 函式庫整合,實現高性能執行。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案