openspeech-team/openspeech

Open-Source Toolkit for End-to-End Speech Recognition leveraging PyTorch-Lightning and Hydra.

解決的問題

OpenSpeech 是一個專為簡化端對端(E2E)自動語音辨識(ASR)系統建構而設計的框架。它取代了傳統的「混合」ASR 系統——這些系統需要分別為聲學模型、語言模型和發音模型進行複雜的訓練——改用單一整合式方法,大幅減少訓練與解碼時間。

如何運作

基於 PyTorch-Lightning 與 Hydra 建構,OpenSpeech 提供一個與硬體無關的 ASR 模型訓練環境。使用者無需複雜工程即可輕鬆運用混合精度訓練、多節點訓練與 TPU 支援等進階功能。此框架包含超過 20 篇 ASR 模型論文的參考實作,支援常見的音訊特徵(如頻譜圖、梅爾頻譜圖、濾波器組、MFCC),以及 SpecAugment 等多種資料增強技術。

適用對象

專為研究人員、教育工作者與實務者設計,適合希望實驗知名 ASR 模型,或使用提供的模組與英語、中文、韓語配方建構自訂語音辨識器的人群。

主要特色

  • 廣泛的模型圖書館:支援 20 種以上的 ASR 架構,包括 Conformer、Transformer、Jasper、QuartzNet 與 DeepSpeech2。
  • 硬體無關:透過 PyTorch-Lightning 順暢支援 GPU 與 TPU 訓練。
  • 語言配方:內建 LibriSpeech(英語)、AISHELL-1(中文)與 KsponSpeech(韓語)的預設設定配方。
  • 彈性配置:使用 Hydra 進行訓練超參數的階層式、動態配置管理。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案