FireRedTeam/FireRedASR2S
A SOTA Industrial-Grade All-in-One ASR system with ASR, VAD, LID, and Punc modules. FireRedASR2 supports Chinese (Mandarin, 20+ dialects/accents), English, code-switching, and both speech and singing ASR. FireRedVAD supports speech/singing/music in 100+ langs. FireRedLID supports 100+ langs and 20+ zh dialects. FireRedPunc supports zh and en.
What it solves
FireRedASR2S 是一个工业级、全能型自动语音识别 (ASR) 系统,旨在处理复杂的音频转录任务。它解决了对统一流水线的需求,该流水线能够检测语音活动、识别所说语言(包括众多中文方言)、转录语音和歌唱,并自动为生成的文本添加标点符号。
How it works
该系统集成了四个专门的模块,可以作为一个完整的流水线共同使用,也可以独立使用:
- FireRedASR2: 核心转录引擎。它提供两个变体:一个用于实现最先进性能和端到端交互的 LLM-based 版本,以及一个在性能与计算效率之间取得平衡的 AED (Attention-based Encoder-Decoder) 版本。
- FireRedVAD: 语音活动检测模块,可识别 100 多种语言中的语音、歌唱或音乐。它支持流式和非流式模式。
- FireRedLID: 语种识别模块,可识别 100 多种语言和 20 多种中文方言/口音。
- FireRedPunc: 标点预测模块,可为中文和英文转录文本添加适当的标点符号。
Who it’s for
该系统适用于正在构建工业级语音转文本应用的开发者和工程师,特别是那些对普通话、各种中文方言、英语以及语码转换场景有高准确度要求的应用。
Highlights
- Comprehensive Dialect Support: 高准确度的普通话和 20 多种中文方言/口音(例如,粤语、四川话、上海话)。
- All-in-One Pipeline: 将 VAD、LID、ASR 和标点符号功能集成在单个系统中。
- Flexible Architectures: 提供 LLM 和 AED 模型变体,可在最高准确度与更高效率之间进行选择。
- High Performance: 在 CER 和 F1 分数方面优于多个行业基准(例如 Whisper 和 Fun-ASR)。
- Inference Acceleration: 支持 TensorRT-LLM 以实现显著加速(高达 12.7 倍)并与 vLLM 集成以实现高性能服务。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目