TensorSpeech/TensorFlowASR
:zap: TensorFlowASR: Almost State-of-the-art Automatic Speech Recognition in Tensorflow 2. Supported languages that can use characters or subwords
What it solves
様々な ASR アーキテクチャを使用して、音声オーディオをテキストに変換するための、自動音声認識 (ASR) システムの構築とトレーニングのためのフレームワークを提供します。
How it works
このプロジェクトは、学習損失関数によって分類されたいくつかの ASR アーキテクチャを実装しています:Transducer モデル (RNNT Loss を使用) の Conformer や ContextNet、および CTC モデル (CTC Loss を使用) の DeepSpeech2 や Jasper です。
特徴抽出やデータ拡張のためのツールが含まれており、学習済みモデルを TFLite 形式に変換して、デプロイ時のメモリ使用量と計算量を最適化することをサポートしています。
Who it’s for
TensorFlow エコシステムを好み、TFLite を介してエッジデバイスにデプロイ可能なしモデルが必要な、音声からテキストへのアプリケーション開発者や研究者です。
Highlights
- 多様なアーキテクチャをサポート:Conformer, ContextNet, RNN Transducer, DeepSpeech2, Jasper。
- Streaming Conformer によるストリーミング機能を提供。
- 効率的なデプロイのための TFLite 変換パスを提供。
- 英語 (LibriSpeech, Common Voice) やベトナム語のコーパスを含む、多様な数据集をサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト