sooftware/conformer
[Unofficial] PyTorch implementation of "Conformer: Convolution-augmented Transformer for Speech Recognition" (INTERSPEECH 2020)
解決する課題
音声認識において、TransformerまたはCNNのいずれか一方のみを使用することの限界に対処します。Transformerは広域的な相互作用を捉えるのに優れていますが、CNNは局所的な特徴の抽出に長けています。このプロジェクトは、音声シーケンス内の両方の依存関係を効率的にモデル化するために、ConformerアーキテクチャのPyTorch実装を提供します。
仕組み
このプロジェクトは、畳み込みを拡張したTransformerであるConformerモデルを実装しています。CNNとTransformerの強みを組み合わせることで、モデルは音声シーケンス内の局所的および大域的な依存関係を、パラメータ効率の高い方法で捉えることができます。
対象者
これは、ConformerアーキテクチャをPyTorchベースの音声処理パイプラインに統合したい、自動音声認識(ASR)に取り組んでいる開発者や研究者向けです。
ハイライト
- ConformerアーキテクチャのPyTorch実装。
- CNNとTransformerを組み合わせ、音声認識の精度を向上。
- 音声シーケンスのパラメータ効率の高いモデリング。
- 学習用にCTC Lossに対応。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト