salute-developers/GigaAM
Foundational Model for Speech Recognition Tasks
何を解決するか
GigaAM は、高性能な音声処理向けに設計されたオープンソース音声モデルのファミリーです。これは、ロシア語およびいくつかの未代表的な言語(カザフ語、キルギス語、ウズベク語など)における最先端(SoTA)の音声認識(ASR)および感情認識のニーズに対応しています。
動作方法
Conformerベースの基礎モデル(220M~600Mパラメータ)を用いて、巨大量の音声データ(多言語版では最大200万時間)で事前学習しています。システムは、Connectionist Temporal Classification(CTC)やRecurrent Neural Network Transducer(RNNT)といった異なるデコード戦略を採用し、音声をテキストに変換します。また、自己教師学習(SSL)バックボーンによる音声埋め込み抽出や、感情検出に特化したモデルもサポートしています。
対象ユーザー
音声からテキストへの変換アプリケーション、感情分析、多言語音声処理に取り組む開発者や研究者。特にロシア語圏や未代表的な言語をターゲットにしている方々に適しています。
主な特徴
- 多言語対応:70以上の言語で事前学習済み。ロシア語、カザフ語、キルギス語、ウズベク語において高い性能を発揮。
- エンドツーエンドASR:
v3_e2eモデルを含み、句読点やテキスト正規化をサポート。Whisper-large-v3と並べた比較で優れた性能を示す。 - デプロイの柔軟性:ONNXエクスポートによりGPU推論を高速化し、Triton Inference ServerやTensorRTとの統合も可能。
- 多様なタスク対応:音声埋め込み抽出、単語レベルのタイムスタンプ、外部の音声活動検出(VAD)を用いた長文トランスクリプションが可能。
- 微調整可能:PyTorch Lightningを用いてカスタムデータセットでモデルの微調整が可能。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch