netease-youdao/Confucius4-R2T2

Confucius4-R2T2: A Low Latency and High Accuracy Real-Time Speech Recognition Model

해결하는 문제

Confucius4-R2T2는 저지연과 고정확도를 모두 갖춘 실시간 자동 음성 인식(ASR)을 만드는 과제를 해결합니다. 특히, 많은 스트리밍 ASR 시스템에서 흔한 "시각적 깜빡임"과 방해가 되는 텍스트 수정 문제를 추가 전용(append-only) 출력 모드를 사용하여 해결합니다. 이 모드에서는 출력된 텍스트가 영구적으로 확정되어 수정되지 않습니다.

작동 방식

R2T2는 Qwen3-ASR 모델을 기반으로, 최장 안정 접두사(LSP) 학습 패러다임을 활용합니다. 이를 통해 모델은 추가 오디오 컨텍스트 없이 텍스트 세그먼트(안정 접두사)를 안전하게 출력할 수 있는 시점을 동적으로 결정할 수 있습니다. 이를 위해 안정 접두사 데이터, 강제 시간 정렬 데이터, 토큰 수준 오디오 분할과 같은 특수 데이터 구축 기술을 사용하여 훈련되었습니다. 또한 지연 시간과 정확도 간의 균형을 조정할 수 있도록 80ms에서 2초까지 구성 가능한 디코딩 청크를 지원합니다.

대상 사용자

이 프로젝트는 즉각적이고 안정적인 텍스트 출력이 필요한 애플리케이션을 구축하는 개발자와 연구자를 위해 설계되었습니다. 예:

  • 실시간 라이브 캡셔닝 및 자막.
  • 다운스트림 NLP 파이프라인 및 LLM 에이전트.
  • 동시 음성 번역 시스템.

주요 특징

  • 진정한 스트리밍 출력: 추가 전용 모드로 텍스트를 출력하여 이전에 출력된 단어가 수정되지 않도록 보장합니다.
  • 저지연: 평균 지연 시간 200~600밀리초.
  • 고정확도: 오프라인 ASR에 가까운 인식 품질 유지.
  • 유연한 구성: 80ms~2초의 디코딩 청크 지원.
  • 높은 처리량: vLLM 백엔드로 효율적인 추론.
  • 다국어 지원: 중국어와 영어에 최적화되어 있으며, 다양한 다른 언어도 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트