salute-developers/GigaAM

Foundational Model for Speech Recognition Tasks

何を解決するか

GigaAM は、高性能な音声処理向けに設計されたオープンソース音声モデルのファミリーです。これは、ロシア語およびいくつかの未代表的な言語(カザフ語、キルギス語、ウズベク語など)における最先端(SoTA)の音声認識(ASR)および感情認識のニーズに対応しています。

動作方法

Conformerベースの基礎モデル(220M~600Mパラメータ)を用いて、巨大量の音声データ(多言語版では最大200万時間)で事前学習しています。システムは、Connectionist Temporal Classification(CTC)やRecurrent Neural Network Transducer(RNNT)といった異なるデコード戦略を採用し、音声をテキストに変換します。また、自己教師学習(SSL)バックボーンによる音声埋め込み抽出や、感情検出に特化したモデルもサポートしています。

対象ユーザー

音声からテキストへの変換アプリケーション、感情分析、多言語音声処理に取り組む開発者や研究者。特にロシア語圏や未代表的な言語をターゲットにしている方々に適しています。

主な特徴

  • 多言語対応:70以上の言語で事前学習済み。ロシア語、カザフ語、キルギス語、ウズベク語において高い性能を発揮。
  • エンドツーエンドASRv3_e2eモデルを含み、句読点やテキスト正規化をサポート。Whisper-large-v3と並べた比較で優れた性能を示す。
  • デプロイの柔軟性:ONNXエクスポートによりGPU推論を高速化し、Triton Inference ServerやTensorRTとの統合も可能。
  • 多様なタスク対応:音声埋め込み抽出、単語レベルのタイムスタンプ、外部の音声活動検出(VAD)を用いた長文トランスクリプションが可能。
  • 微調整可能:PyTorch Lightningを用いてカスタムデータセットでモデルの微調整が可能。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch