TensorSpeech/TensorFlowASR

:zap: TensorFlowASR: Almost State-of-the-art Automatic Speech Recognition in Tensorflow 2. Supported languages that can use characters or subwords

What it solves

它提供了一個用於建立與訓練自動語音辨識 (ASR) 系統的框架,能夠使用各種尖端的神經網路架構將口語音訊轉換為文字。

How it works

該專案實作了幾種根據其訓練損失函數分類的 ASR 架構:Transducer 模型(使用 RNNT Loss)如 Conformer 和 ContextNet,以及 CTC 模型(使用 CTC Loss)如 DeepSpeech2 和 Jasper。它包含用於特徵提取與資料增強的工具,並支援將訓練好的模型轉換為 TFLite 格式,以優化部署時的記憶體與運算量。

Who it’s for

對於偏好 TensorFlow 生態系統,且需要能透過 TFLite 部署到邊緣裝置的語音轉文字應用程式開發者與研究人員。

Highlights

  • 支援多種架構:Conformer, ContextNet, RNN Transducer, DeepSpeech2, 以及 Jasper。
  • 透過 Streaming Conformer 提供串流功能。
  • 提供轉換至 TFLite 的路徑,以實現高效能部署。
  • 支援多種資料集,包括英文 (LibriSpeech, Common Voice) 與越南文語料庫。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案