FireRedTeam/FireRedASR2S
A SOTA Industrial-Grade All-in-One ASR system with ASR, VAD, LID, and Punc modules. FireRedASR2 supports Chinese (Mandarin, 20+ dialects/accents), English, code-switching, and both speech and singing ASR. FireRedVAD supports speech/singing/music in 100+ langs. FireRedLID supports 100+ langs and 20+ zh dialects. FireRedPunc supports zh and en.
What it solves
FireRedASR2Sは、複雑な音声文字起こしタスクを処理するために設計された、産業グレードのオールインワン自動音声認識(ASR)システムです。音声活動の検出、話されている言語の特定(多数の中国語方言を含む)、音声や歌唱の文字起こし、および生成されたテキストへの自動句読点付与のニーズに応える、統合されたパイプラインを提供します。
How it works
このシステムは、組み合わせて完全なパイプラインとして使用することも、個別に使用することもできる4つの特化型モジュールを統合しています:
- FireRedASR2: コアとなる文字起こしエンジンです。最先端のパフォーマンスとエンドツーエンドのインタラクションを実現するLLM-basedバージョンと、パフォーマンスと計算効率のバランスが取れた**AED (Attention-based Encoder-Decoder)**バージョンの2つのバリエーションを提供します。
- FireRedVAD: 100以上の言語にわたって音声、歌唱、または音楽を識別する音声活動検出(VAD)モジュールです。ストリーミングおよび非ストリーミングの両方のモードをサポートしています。
- FireRedLID: 100以上の言語と20以上の中国語方言/アクセントを認識する話者言語識別(LID)モジュールです。
- FireRedPunc: 中国語と英語の文字起こしに適切な句読点を追加する句読点予測モジュールです。
Who it’s for
このシステムは、産業グレードの音声からテキストへのアプリケーションを構築する開発者やエンジニア、特に標準中国語、様々な中国語方言、英語、およびコードスイッチング(言語の混在)シナリオにおいて高い精度を必要とする人々を対象としています。
Highlights
- Comprehensive Dialect Support: 標準中国語および20以上の中国語方言/アクセント(例:広東語、四川語、上海語)に対して高い精度を実現します。
- All-in-One Pipeline: VAD、LID、ASR、および句読点付与を単一のシステムに統合しています。
- Flexible Architectures: 最大限の精度とより高い効率性の間で選択できるよう、LLMとAEDの両方のモデルバリエーションを提供します。
- High Performance: CERおよびF1スコアにおいて、いくつかの業界ベンチマーク(WhisperやFun-ASRなど)を上回る性能を発揮します。
- Inference Acceleration: TensorRT-LLMをサポートしており、大幅な高速化(最大12.7倍)を実現し、vLLMと統合して高性能なサービングを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト