Qwen3-ASR 및 Qwen3-ForcedAligner 릴리스
Qwen은 Qwen3-ASR 및 Qwen3-ForcedAligner 모델군을 오픈소스로 공개하여 고성능 다국어 음성 인식 및 정밀 타임스탬프 정렬 도구를 소개합니다. 이 모델들은 Qwen3-Omni 기반 모델의 오디오 이해 능력을 활용하여 수십 개의 언어와 방언에 걸쳐 강력한 전사와 정렬을 제공합니다.
Qwen3-ASR: 다국어 음성 인식
Qwen3-ASR는 Qwen3-ASR-1.7B와 Qwen3-ASR-0.6B 두 개의 올인원 모델로 구성되어 있으며, 언어 식별과 자동 음성 인식(ASR)을 하나의 파이프라인에 통합합니다.
주요 기능 및 언어 지원
두 모델 모두 30개 언어와 22개의 중국 방언을 지원하며, 다양한 국가와 지역의 영어 억양도 포함합니다. 지원되는 언어는 중국어(zh), 영어(en), 광동어(yue), 아랍어(ar), 독일어(de), 프랑스어(fr), 스페인어(es), 포르투갈어(pt), 인도네시아어(id), 이탈리아어(it), 한국어(ko), 러시아어(ru), 태국어(th), 베트남어(vi), 일본어(ja), 터키어(tr), 힌디어(hi), 말레이어(ms), 네덜란드어(nl), 스웨덴어(sv), 덴마크어(da), 핀란드어(fi), 폴란드어(pl), 체코어(cs), 필리핀어(fil), 페르시아어(fa), 그리스어(el), 헝가리어(hu), 마케도니아어(mk), 루마니아어(ro)를 포함합니다.
성능 및 벤치마크
Qwen3-ASR-1.7B는 고성능 변형으로, 오픈소스 ASR 모델 중 최첨단(SOTA) 결과를 달성하고 상용 독점 API와도 경쟁력을 유지합니다.
- English: 16개 국가의 억양을 포함한 내부 테스트 세트에서 GPT-4o Transcribe, Gemini 시리즈, Doubao ASR, Whisper-large-v3보다 우수합니다.
- Multilingual: 20개 주요 언어에서 기존 오픈소스 모델을 능가하며 평균 단어 오류율(WER) 최저를 기록합니다.
- Chinese and Dialects: 표준 중국어, 광동어 및 22개 지역 방언에서 상용 API와 오픈소스 모델 모두를 앞섭니다.
- Robustness: 어린이·노인 음성이나 매우 낮은 신호대잡음비(SNR) 환경 등 어려운 상황에서도 낮은 문자/단어 오류율을 유지합니다.
- Singing Voice: 배경음악(BGM)이 포함된 중국어와 영어 전체 노래 전사를 지원하며, 평균 WER은 중국어 13.91%, 영어 14.60%입니다.
효율성 및 처리량
Qwen3-ASR-0.6B는 정확도와 효율성의 균형을 위해 최적화되었습니다. 동시성 128을 갖춘 온라인 비동기 모드에서 1초에 2,000초(5시간 분량)의 음성을 전사할 수 있으며, 첫 토큰까지의 시간(time-to-first-token)은 92 ms에 달합니다.
Qwen3-ForcedAligner: 정밀 타임스탬프 예측
Qwen3-ForcedAligner-0.6B는 텍스트-음성 쌍을 정렬하도록 설계된 비자동회귀(NAR) LLM 기반 타임스탬프 예측기입니다.
기술 사양
- Language Support: 11개 언어를 지원합니다.
- Capacity: 최대 5분 길이의 음성에 대해 임의 단위의 타임스탬프를 예측할 수 있습니다.
- Performance: Nemo-Forced-Aligner, WhisperX, Monotonic-Aligner 등 E2E 기반 강제 정렬 모델보다 타임스탬프 정확도, 언어 커버리지, 지원 오디오 길이 측면에서 우수합니다.
배포 및 프레임워크
커뮤니티 채택을 촉진하기 위해 Qwen은 Apache 2.0 라이선스 하에 포괄적인 추론-미세조정 프레임워크를 공개했습니다. 이 툴킷은 다음을 지원합니다:
- vLLM 기반 배치 추론
- 비동기 서비스
- 스트리밍 추론
- 타임스탬프 예측
- 단일 모델을 사용한 통합 오프라인 및 스트리밍 추론
- 최대 20분 길이의 단일 긴 오디오 파일 전사