salute-developers/GigaAM

Foundational Model for Speech Recognition Tasks

解決的問題

GigaAM 提供一組開源聲學模型,專為高效率語音處理而設計。它解決了俄語以及若干低資源語言(如哈薩克語、吉爾吉斯語和烏茲別克語)的最尖端(SoTA)自動語音辨識(ASR)與情感辨識的需求。

工作原理

它使用基於 Conformer 的基礎模型(參數量從 2.2 億到 6 億不等),在巨量語音資料上進行預訓練——多語言版本最多達 200 萬小時。該系統採用多種解碼策略,包括連接時序分類(CTC)與循環神經網路轉換器(RNNT),將音訊轉換為文字。它還支援自監督學習(SSL)骨幹網路用於音訊嵌入提取,並提供專門用於情感檢測的模型。

適用對象

從事語音轉文字應用、情感分析與多語言音訊處理的開發者與研究人員,特別是針對俄語地區或低資源語言的專案。

主要亮點

  • 多語言支援:在 70 多種語言上進行預訓練,在俄語、哈薩克語、吉爾吉斯語與烏茲別克語上表現優異。
  • 端對端 ASR:包含 v3_e2e 模型,支援標點符號與文字規範化,在與 Whisper-large-v3 的並列對比中表現更佳。
  • 部署彈性:支援 ONNX 導出,實現更快的 GPU 推理,並可與 Triton Inference Server 和 TensorRT 集成。
  • 多功能任務:支援音訊嵌入提取、單字級時間戳,以及透過外部語音活動檢測(VAD)實現長篇轉錄。
  • 可微調:可使用 PyTorch Lightning 在自訂資料集上對模型進行微調。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • Dispatch