flashlight/wav2letter

Facebook AI Research's Automatic Speech Recognition Toolkit

解決的問題

wav2letter++ 旨在為端到端自動語音識別 (ASR) 提供高性能框架,能夠復現各種研究論文,並使用預訓練模型將語音轉換為文本。

工作原理

該專案提供了一套與 Flashlight 機器學習函式庫集成的方案與預訓練模型。它支援多種 ASR 架構,包括串流 ConvNets、具有時間深度分離卷積的 sequence-to-sequence 模型以及無詞典語音識別。

適用對象

主要面向從事語音識別工作的研究人員與開發人員,特別是那些尋求復現學術成果或實現最先進 ASR 架構的人員。

亮點

  • 支援多種基於研究的 ASR 架構,包括 ConvNets 與 Seq2Seq。
  • 提供用於語音識別的半監督學習與自我訓練方案。
  • 包含可直接使用的預訓練模型。
  • 與 Flashlight 函式庫整合,實現高性能執行。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案