yeyupiaoling/MASR

Pytorch实现的流式与非流式的自动语音识别框架,同时兼容在线和离线识别,目前支持Conformer、Squeezeformer、DeepSpeech2模型,支持多种数据增强方法。

何を解決するか

MASR(Magical Automatic Speech Recognition)は、自動音声認識(ASR)をシンプルかつ実用的にするためのPyTorchベースのフレームワークです。リアルタイム(ストリーミング)およびバッチ(非ストリーミング)処理を、さまざまな言語とプラットフォームでサポートする、音声をテキストに変換する統合システムを提供します。

動作方法

このフレームワークは、音声前処理から最終的なテキスト出力までの完全なASRパイプラインを実装しています:

  • モデル: Conformer、Squeezeformer、Efficient Conformer、DeepSpeech2など、複数のアーキテクチャをサポートしています。
  • 前処理: fbankやmfccなどの手法を使用して音声を処理し、kaldi_native_fbankライブラリを活用することで、高速性とクロスプラットフォーム互換性を向上させています。
  • デコード: CTCグリーディ検索、CTCプレフィックスビームサーチ、CTCビームサーチ、アテンションリスコアリングなどのさまざまなデコード戦略を採用しています。
  • トークン化: sentencepieceを使用してトークン化しており、複数言語の取り扱いを簡素化し、中国語と英語の混合学習を可能にしています。
  • データ拡張: ノイズ、リバーブ、スピード、ボリューム、リサンプリング、シフト拡張に加え、SpecAugmentとSpecSubAugmentを含む、堅牢性を向上させるための拡張機能を備えています。

対象ユーザー

MASRは、サーバー、Nvidia Jetsonデバイス、および将来的にはモバイルデバイス(Android)で実行可能なデプロイ可能なASRシステムが必要な開発者や研究者を対象としています。

主な特徴

  • 柔軟な推論: 短い音声、長い音声、ストリーミング、話者ダイアライゼーションベースの推論をサポートしています。
  • 多言語対応: 普通話、英語、広東語、ウイグル語を含む、中国語と英語の混合モデルも対応可能です。
  • クロスプラットフォーム: Windows、Linux、macOSと互換性があります。
  • 包括的なツールキット: データ準備、合成音声生成、モデル学習、評価、モデルエクスポートのための組み込みスクリプトを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト