FireRedTeam/FireRedASR2S

A SOTA Industrial-Grade All-in-One ASR system with ASR, VAD, LID, and Punc modules. FireRedASR2 supports Chinese (Mandarin, 20+ dialects/accents), English, code-switching, and both speech and singing ASR. FireRedVAD supports speech/singing/music in 100+ langs. FireRedLID supports 100+ langs and 20+ zh dialects. FireRedPunc supports zh and en.

What it solves

FireRedASR2S는 복잡한 오디오 전사 작업을 처리하도록 설계된 산업용 등급의 올인원 자동 음성 인식(ASR) 시스템입니다. 이 시스템은 음성 활동을 감지하고, 구사 언어(수많은 중국어 방언 포함)를 식별하며, 음성 및 노래를 전사하고, 결과 텍스트에 자동으로 문장 부호를 추가할 수 있는 통합 파이프라인의 필요성을 해결합니다.

How it works

이 시스템은 함께 사용하여 완전한 파이프라인으로 작동하거나 독립적으로 사용할 수 있는 네 가지 전문 모듈을 통합합니다:

  • FireRedASR2: 핵심 전사 엔진입니다. 최첨단 성능과 엔드투엔드 상호작용을 위한 LLM-based 버전과 성능과 계산 효율성 사이의 균형을 맞춘 AED (Attention-based Encoder-Decoder) 버전의 두 가지 변형을 제공합니다.
  • FireRedVAD: 100개 이상의 언어에서 음성, 노래 또는 음악을 식별하는 음성 활동 감지(Voice Activity Detection) 모듈입니다. 스트리밍 및 비스트리밍 모드를 모두 지원합니다.
  • FireRedLID: 100개 이상의 언어와 20개 이상의 중국어 방언/억양을 인식하는 구사 언어 식별(Spoken Language Identification) 모듈입니다.
  • FireRedPunc: 중국어 및 영어 전사 결과에 적절한 문장 부호를 추가하는 문장 부호 예측 모듈입니다.

Who it’s for

이 시스템은 산업용 등급의 음성-텍스트 변환 애플리케이션을 구축하는 개발자와 엔지니어를 대상으로 하며, 특히 표준 중국어(Mandarin), 다양한 중국어 방언, 영어 및 코드 스위칭(code-switching) 시나리오에서 높은 정확도가 필요한 경우에 적합합니다.

Highlights

  • Comprehensive Dialect Support: 표준 중국어 및 20개 이상의 중국어 방언/억양(예: 광둥어, 사천어, 상하이 방언)에 대해 높은 정확도를 제공합니다.
  • All-in-One Pipeline: VAD, LID, ASR, 및 Punctuation를 단일 시스템에서 결합합니다.
  • Flexible Architectures: 최대 정확도와 높은 효율성 사이에서 선택할 수 있도록 LLM 및 AED 모델 변형을 모두 제공합니다.
  • High Performance: CER 및 F1 점수에서 여러 산업 벤치마크(Whisper 및 Fun-ASR 등)를 능가합니다.
  • Inference Acceleration: 상당한 속도 향상(최대 12.7배)을 위한 TensorRT-LLM을 지원하며, 고성능 서빙을 위해 vLLM과 통합됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트