TensorSpeech/TensorFlowASR

:zap: TensorFlowASR: Almost State-of-the-art Automatic Speech Recognition in Tensorflow 2. Supported languages that can use characters or subwords

What it solves

様々な ASR アーキテクチャを使用して、音声オーディオをテキストに変換するための、自動音声認識 (ASR) システムの構築とトレーニングのためのフレームワークを提供します。

How it works

このプロジェクトは、学習損失関数によって分類されたいくつかの ASR アーキテクチャを実装しています:Transducer モデル (RNNT Loss を使用) の Conformer や ContextNet、および CTC モデル (CTC Loss を使用) の DeepSpeech2 や Jasper です。

特徴抽出やデータ拡張のためのツールが含まれており、学習済みモデルを TFLite 形式に変換して、デプロイ時のメモリ使用量と計算量を最適化することをサポートしています。

Who it’s for

TensorFlow エコシステムを好み、TFLite を介してエッジデバイスにデプロイ可能なしモデルが必要な、音声からテキストへのアプリケーション開発者や研究者です。

Highlights

  • 多様なアーキテクチャをサポート:Conformer, ContextNet, RNN Transducer, DeepSpeech2, Jasper。
  • Streaming Conformer によるストリーミング機能を提供。
  • 効率的なデプロイのための TFLite 変換パスを提供。
  • 英語 (LibriSpeech, Common Voice) やベトナム語のコーパスを含む、多様な数据集をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト