openspeech-team/openspeech

Open-Source Toolkit for End-to-End Speech Recognition leveraging PyTorch-Lightning and Hydra.

何を解決するか

OpenSpeechは、エンドツーエンド(E2E)自動音声認識(ASR)システムの構築を簡素化するためのフレームワークです。従来の「ハイブリッド」ASRシステム(音響モデル、言語モデル、発音モデルのそれぞれを別々に複雑に訓練する必要がある)に代わり、1つの統合的なアプローチを提供し、トレーニングおよびデコード時間を短縮します。

どう動くか

PyTorch-LightningとHydraに基づいて構築されたOpenSpeechは、ASRモデルのトレーニングにハードウェアに依存しない環境を提供します。混合精度トレーニング、マルチノードトレーニング、TPUサポートといった高度な機能を、複雑なエンジニアリングなしに活用できます。このフレームワークには20以上のASRモデル論文の参照実装が含まれており、スペクトログラム、メルスペクトログラム、フィルターバンク、MFCCといった一般的な音声特徴のサポート、SpecAugmentを含むさまざまなデータ拡張技術も提供しています。

誰向けか

研究者、教育者、実務家向けに設計されており、有名なASRモデルを実験したり、英語、中国語、韓国語用の提供されたモジュールとレシピを使ってカスタム音声認識器を構築したい人を対象としています。

特徴

  • 広範なモデルライブラリ: Conformer、Transformer、Jasper、QuartzNet、DeepSpeech2などを含む20以上のASRアーキテクチャをサポート。
  • ハードウェアに依存しない: PyTorch-Lightningを介してGPUおよびTPUトレーニングをスムーズにサポート。
  • 言語レシピ: LibriSpeech(英語)、AISHELL-1(中国語)、KsponSpeech(韓国語)用の事前構成済みレシピを含む。
  • 柔軟な構成: トレーニングハイパーパラメータの階層的・動的構成管理にHydraを使用。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト