wenet-e2e/wenet

Production First and Production Ready End-to-End Speech Recognition Toolkit

解決する課題

WeNetは、end-to-end音声認識のためのプロダクション対応ツールキットです。正確で軽量、かつ実際のプロダクション環境向けに設計されたフルスタックのソリューションを提供することで、研究とデプロイの間のギャップを埋めることを目的としています。

仕組み

WeNetは、ストリーミングおよび非ストリーミングの両方の音声認識のためのフレームワークを提供します。英語と中国語の文字起こしのために、Paraformer、FireRed、Whisper (large-v3 および large-v3-turbo) などの複数のモデルをサポートしています。システムには、簡単な文字起こしのための Python パッケージと、デプロイ用の個別のランタイムが含まれており、パフォーマンスを最適化するために x86 プラットフォーム向けにビルドできます。

対象者

プロダクション環境で高精度な音声文字起こしシステムを実装する必要がある開発者やエンジニア、およびend-to-end音声認識モデルを構築・訓練したい研究者。

ハイライト

  • プロダクション対応: フルスタックのソリューションを備え、プロダクション環境向けに特別に設計されています。
  • SOTAの結果: さまざまな公開音声データセットにおいて、最先端(state-of-the-art)の結果を達成しています。
  • 簡単なインストール: 素早い開始のための Python パッケージ、または訓練とデプロイのためのフルインストールが利用可能です。
  • 幅広いハードウェアサポート: 加速のために CUDA および Ascend NPU をサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト