yeyupiaoling/MASR
Pytorch实现的流式与非流式的自动语音识别框架,同时兼容在线和离线识别,目前支持Conformer、Squeezeformer、DeepSpeech2模型,支持多种数据增强方法。
解決的問題
MASR(Magical Automatic Speech Recognition)是基於 PyTorch 的框架,旨在讓自動語音辨識(ASR)變得簡單且實用。它提供了一個統一的系統,可將語音轉換為文字,支援跨多種語言與平台的即時(串流)與批次(非串流)處理。
工作原理
此框架實作了從音訊預處理到最終文字輸出的完整 ASR 流程:
- 模型:支援多種架構,包括 Conformer、Squeezeformer、Efficient Conformer 與 DeepSpeech2。
- 預處理:使用 fbank 與 mfcc 等方法處理音訊,並利用
kaldi_native_fbank套件以提升速度與跨平台相容性。 - 解碼:採用多種解碼策略,如 CTC 貪心搜尋、CTC 前綴束搜尋、CTC 束搜尋與注意力重評分。
- 分詞:使用
sentencepiece進行分詞,簡化多語言處理,並支援中英文混合訓練。 - 資料增強:為提升穩健性,包含雜訊、混響、速度、音量、重取樣、位移增強,以及 SpecAugment 與 SpecSubAugment。
適用對象
MASR 適用於需要在伺服器、Nvidia Jetson 裝置上執行,甚至未來可部署至行動裝置(Android)的可部署式 ASR 系統之開發者與研究人員。
主要特色
- 彈性推論:支援短音訊、長音訊、串流與基於說話人分離的推論。
- 多語言支援:可處理普通話、英語、粵語與維吾爾語,包含中英文混合模型。
- 跨平台相容:支援 Windows、Linux 與 macOS。
- 完整工具鏈:內建腳本用於資料準備、合成語音產生、模型訓練、評估與模型匯出。
相關
- 專案
- 專案
- 專案
- 專案
- 專案