openspeech-team/openspeech
Open-Source Toolkit for End-to-End Speech Recognition leveraging PyTorch-Lightning and Hydra.
解決的問題
OpenSpeech 是一個專為簡化端對端(E2E)自動語音辨識(ASR)系統建構而設計的框架。它取代了傳統的「混合」ASR 系統——這些系統需要分別為聲學模型、語言模型和發音模型進行複雜的訓練——改用單一整合式方法,大幅減少訓練與解碼時間。
如何運作
基於 PyTorch-Lightning 與 Hydra 建構,OpenSpeech 提供一個與硬體無關的 ASR 模型訓練環境。使用者無需複雜工程即可輕鬆運用混合精度訓練、多節點訓練與 TPU 支援等進階功能。此框架包含超過 20 篇 ASR 模型論文的參考實作,支援常見的音訊特徵(如頻譜圖、梅爾頻譜圖、濾波器組、MFCC),以及 SpecAugment 等多種資料增強技術。
適用對象
專為研究人員、教育工作者與實務者設計,適合希望實驗知名 ASR 模型,或使用提供的模組與英語、中文、韓語配方建構自訂語音辨識器的人群。
主要特色
- 廣泛的模型圖書館:支援 20 種以上的 ASR 架構,包括 Conformer、Transformer、Jasper、QuartzNet 與 DeepSpeech2。
- 硬體無關:透過 PyTorch-Lightning 順暢支援 GPU 與 TPU 訓練。
- 語言配方:內建 LibriSpeech(英語)、AISHELL-1(中文)與 KsponSpeech(韓語)的預設設定配方。
- 彈性配置:使用 Hydra 進行訓練超參數的階層式、動態配置管理。
相關
- 專案
- 專案
- 專案
- 專案
- 專案