AudarAI/Audar-ASR-V1
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
해결하는 문제
Audar-ASR-V1은 아랍어 방언(예: 갈프/아랍에미리트, 이집트, 레바논-시리아, 마그레브 등)과 아랍어-영어 혼합 언어 음성에 대해 고정밀 음성-텍스트 변환을 제공합니다. 일반적인 ASR 시스템보다 이러한 특정 언어적 특징에서 더 뛰어난 성능을 발휘하도록 설계되었습니다.
작동 방식
이 프로젝트는 음성 인식을 '음성 조건부 다음 토큰 예측'으로 간주하는 생성형 접근 방식을 사용합니다. 오픈웨이트 음성 LLM 기반으로 구축되었으며, 30만 시간 이상의 레이블링된 음성 데이터를 활용해 적응시켰습니다. 훈련 과정은 4단계 커리큘럼을 거쳐, 원어민 아랍어 아노테이터의 KTO 선호도 정렬로 마무리됩니다.
아키텍처적으로는 Whisper 스타일의 128-mel 음성 인코더와 Qwen3 디코더를 사용합니다. 두 가지 레벨로 제공됩니다:
- Flash: 소형이며 실시간 처리가 가능한 모델(0.78B 파라미터), 엣지 및 온디바이스 사용에 적합.
- Turbo: 더 큰 크기의 모델(2.35B 파라미터), 어려운 방언 및 긴 형식의 음성에 최적화된 고정밀 모델.
대상 사용자
아랍어 방언과 영어를 포함한 음성의 고정밀 변환을 필요로 하는 개발자들. 총 30개 언어를 지원하는 음성 에이전트, 실시간 자막 서비스, 다양한 애플리케이션 개발에 적합합니다.
주요 특징
- 최첨단 성능: Turbo 레벨에서 Open Universal Arabic ASR 리더보드에서 1위 등극.
- 방언에 충실: 주요 아랍어 방언과 코드 스위칭에 특화되어 최적화됨.
- 유연한 배포: Hugging Face Transformers, GGUF(llama.cpp 경유), vLLM(GPU 서빙용) 등 다양한 런타임 지원.
- 스트리밍 기능: 'LocalAgreement-2' 정책을 구현하여 250ms 미만 지연으로 안정적이고 단계적인 출력 제공.
- 효율적인 확장성: 두 레벨 모두 동일한 프롬프트 인터페이스를 공유하므로, 코드 변경 없이 Flash와 Turbo 간 전환 가능.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch