netease-youdao/Confucius4-R2T2
Confucius4-R2T2: A Low Latency and High Accuracy Real-Time Speech Recognition Model
해결하는 문제
Confucius4-R2T2는 저지연과 고정확도를 모두 갖춘 실시간 자동 음성 인식(ASR)을 만드는 과제를 해결합니다. 특히, 많은 스트리밍 ASR 시스템에서 흔한 "시각적 깜빡임"과 방해가 되는 텍스트 수정 문제를 추가 전용(append-only) 출력 모드를 사용하여 해결합니다. 이 모드에서는 출력된 텍스트가 영구적으로 확정되어 수정되지 않습니다.
작동 방식
R2T2는 Qwen3-ASR 모델을 기반으로, 최장 안정 접두사(LSP) 학습 패러다임을 활용합니다. 이를 통해 모델은 추가 오디오 컨텍스트 없이 텍스트 세그먼트(안정 접두사)를 안전하게 출력할 수 있는 시점을 동적으로 결정할 수 있습니다. 이를 위해 안정 접두사 데이터, 강제 시간 정렬 데이터, 토큰 수준 오디오 분할과 같은 특수 데이터 구축 기술을 사용하여 훈련되었습니다. 또한 지연 시간과 정확도 간의 균형을 조정할 수 있도록 80ms에서 2초까지 구성 가능한 디코딩 청크를 지원합니다.
대상 사용자
이 프로젝트는 즉각적이고 안정적인 텍스트 출력이 필요한 애플리케이션을 구축하는 개발자와 연구자를 위해 설계되었습니다. 예:
- 실시간 라이브 캡셔닝 및 자막.
- 다운스트림 NLP 파이프라인 및 LLM 에이전트.
- 동시 음성 번역 시스템.
주요 특징
- 진정한 스트리밍 출력: 추가 전용 모드로 텍스트를 출력하여 이전에 출력된 단어가 수정되지 않도록 보장합니다.
- 저지연: 평균 지연 시간 200~600밀리초.
- 고정확도: 오프라인 ASR에 가까운 인식 품질 유지.
- 유연한 구성: 80ms~2초의 디코딩 청크 지원.
- 높은 처리량: vLLM 백엔드로 효율적인 추론.
- 다국어 지원: 중국어와 영어에 최적화되어 있으며, 다양한 다른 언어도 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트