허깅 페이스 오픈 ASR 리더보드 트렌드 및 통찰
허깅 페이스는 오픈 ASR 리더보드에 새로운 다국어 및 장문 전사 트랙을 도입하여 짧은 형태의 영어 전사를 넘어 자동 음성 인식(ASR) 모델에 대한 보다 포괄적인 평가를 제공합니다. 2025년 11월 21일 기준으로, 리더보드는 11개 데이터셋에 걸쳐 18개 조직의 60개 이상의 오픈 및 클로즈드 소스 모델을 비교합니다.
영어 정확도: Conformer 인코더와 LLM 디코더
Conformer 인코더와 대형 언어 모델(LLM) 디코더를 결합한 모델은 현재 영어 전사에서 가장 높은 정확도를 달성합니다. 이 범주의 선도 모델로는 NVIDIA의 Canary-Qwen-2.5B, IBM의 Granite-Speech-3.3-8B, Microsoft의 Phi-4-Multimodal-Instruct가 있으며, 모두 LLM 추론을 통합함으로써 단어 오류율(WER)을 크게 낮춘다는 것을 보여줍니다.
이 아키텍처의 효율성을 높이기 위해 NVIDIA는 표준 Conformer보다 두 배 빠른 변형인 "Fast Conformer"를 사용하며, 이는 Canary 및 Parakeet 모델 제품군에 적용됩니다.
속도 대 정확도 트레이드오프
LLM 기반 디코더는 우수한 정확도를 제공하지만, 일반적으로 더 간단한 아키텍처보다 느립니다. 리더보드는 역 실시간 인자(RTFx)를 사용하여 효율을 측정하며, 값이 높을수록 성능이 더 좋음을 나타냅니다.
실시간 전사, 오프라인 배치 처리(강의 또는 팟캐스트)와 같이 높은 처리량이 필요한 애플리케이션에서는 CTC와 TDT 디코더가 최적의 선택입니다. 이러한 디코더는 LLM 기반 대안보다 처리량이 10–100× 빠르지만, 약간 높은 오류율을 초래합니다.
다국어 성능 및 전문화
일반적인 다국어 기능과 단일 언어 전문화 사이에는 문서화된 트레이드오프가 존재합니다. OpenAI의 Whisper Large v3는 99개 언어를 지원하는 강력한 기본 모델로 남아 있지만, Distil-Whisper와 CrisperWhisper와 같은 증류 또는 미세 조정된 변형은 영어 전용 작업에서 원본 모델보다 성능이 더 좋은 경우가 많습니다.
다국어 ASR과 관련된 주요 관찰 사항은 다음과 같습니다:
- 전문화 트레이드오프: 영어 성능에 집중하면 일반적으로 모델의 다국어 커버리지가 감소합니다.
- 자기 지도 학습 시스템: Meta의 Massively Multilingual Speech(MMS)와 Omnilingual ASR은 1,000개 이상의 언어를 지원하지만 정확도 측면에서는 언어별 인코더에 뒤처집니다.
- 지역화된 벤치마크: 커뮤니티 주도의 노력이 언어별 리더보드로 확장되었으며, 예를 들어 Open Universal Arabic ASR 리더보드(현대 표준 아랍어 및 지역 방언 포함)와 Russian ASR 리더보드가 있습니다.
장문 전사 과제
클로즈드 소스 시스템은 맞춤형 청킹, 프로덕션 등급 최적화, 또는 도메인 튜닝 때문일 가능성이 높은 장문 오디오 전사(예: 회의 및 팟캐스트)에서 성능 면에서 여전히 선두를 유지하고 있습니다.
오픈소스 옵션 중에서 정확도 면에서 최고 성능을 보이는 모델은 OpenAI의 Whisper Large v3입니다. 그러나 처리량 측면에서는 CTC 기반 Conformer가 훨씬 더 효율적입니다. 예를 들어, NVIDIA의 Parakeet CTC 1.1B는 RTFx가 2793.75로 Whisper Large v3의 68.56에 비해 훨씬 높으며, WER (6.68 vs 6.43)만 중간 수준 증가합니다.值得注意的是, Parakeet은 영어만 지원하므로 다국어 지원과 전문화 성능 사이의 트레이드오프를 더욱 잘 보여줍니다.