sooftware/conformer

[Unofficial] PyTorch implementation of "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)

解決する課題

音声認識において、TransformerまたはCNNのいずれか一方のみを使用することの限界に対処します。Transformerは広域的な相互作用を捉えるのに優れていますが、CNNは局所的な特徴の抽出に長けています。このプロジェクトは、音声シーケンス内の両方の依存関係を効率的にモデル化するために、ConformerアーキテクチャのPyTorch実装を提供します。

仕組み

このプロジェクトは、畳み込みを拡張したTransformerであるConformerモデルを実装しています。CNNとTransformerの強みを組み合わせることで、モデルは音声シーケンス内の局所的および大域的な依存関係を、パラメータ効率の高い方法で捉えることができます。

対象者

これは、ConformerアーキテクチャをPyTorchベースの音声処理パイプラインに統合したい、自動音声認識(ASR)に取り組んでいる開発者や研究者向けです。

ハイライト

  • ConformerアーキテクチャのPyTorch実装。
  • CNNとTransformerを組み合わせ、音声認識の精度を向上。
  • 音声シーケンスのパラメータ効率の高いモデリング。
  • 学習用にCTC Lossに対応。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト