salute-developers/GigaAM
Foundational Model for Speech Recognition Tasks
解決的問題
GigaAM 提供一組開源聲學模型,專為高效率語音處理而設計。它解決了俄語以及若干低資源語言(如哈薩克語、吉爾吉斯語和烏茲別克語)的最尖端(SoTA)自動語音辨識(ASR)與情感辨識的需求。
工作原理
它使用基於 Conformer 的基礎模型(參數量從 2.2 億到 6 億不等),在巨量語音資料上進行預訓練——多語言版本最多達 200 萬小時。該系統採用多種解碼策略,包括連接時序分類(CTC)與循環神經網路轉換器(RNNT),將音訊轉換為文字。它還支援自監督學習(SSL)骨幹網路用於音訊嵌入提取,並提供專門用於情感檢測的模型。
適用對象
從事語音轉文字應用、情感分析與多語言音訊處理的開發者與研究人員,特別是針對俄語地區或低資源語言的專案。
主要亮點
- 多語言支援:在 70 多種語言上進行預訓練,在俄語、哈薩克語、吉爾吉斯語與烏茲別克語上表現優異。
- 端對端 ASR:包含
v3_e2e模型,支援標點符號與文字規範化,在與 Whisper-large-v3 的並列對比中表現更佳。 - 部署彈性:支援 ONNX 導出,實現更快的 GPU 推理,並可與 Triton Inference Server 和 TensorRT 集成。
- 多功能任務:支援音訊嵌入提取、單字級時間戳,以及透過外部語音活動檢測(VAD)實現長篇轉錄。
- 可微調:可使用 PyTorch Lightning 在自訂資料集上對模型進行微調。
相關
- 專案
- 專案
- Dispatch
- 專案
- Dispatch