AudarAI/Audar-ASR-V1
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
解决的问题
Audar-ASR-V1 为阿拉伯语提供高精度的语音转文字转录,特别针对阿拉伯语方言(如海湾/阿联酋、埃及、黎凡特和马格里布方言)以及阿拉伯语-英语混用语音的挑战。其目标是在这些特定语言特征上超越通用语音识别系统的表现。
工作原理
该项目采用生成式语音识别方法,将转录视为音频条件下的下一个词元预测。它基于开源权重的音频大语言模型(audio-LLM)基础,并利用超过30万小时的标注音频数据进行适配。训练过程包含四阶段课程,最终通过母语阿拉伯语标注员的 KTO 偏好对齐完成。
在架构上,采用 Whisper 风格的 128-mel 音频编码器,搭配 Qwen3 解码器。提供两个版本:
- Flash:小型实时模型(0.78B 参数),适用于边缘设备和本地部署。
- Turbo:更大、更准确的模型(2.35B 参数),适用于复杂方言和长音频。
适用人群
开发语音代理、实时字幕服务,以及需要高精度转录阿拉伯语方言和英语的应用程序的开发者,支持总计 30 种语言。
主要亮点
- 业界领先性能:Turbo 版本在 Open Universal Arabic ASR Leaderboard 上排名第一。
- 方言忠实:专门针对主要阿拉伯语方言和代码切换场景进行优化。
- 灵活部署:支持多种运行时,包括 Hugging Face Transformers、GGUF(通过 llama.cpp)、vLLM(GPU 服务)。
- 流式处理能力:采用「LocalAgreement-2」策略,实现稳定、增量式输出,延迟低于 250ms。
- 高效扩展:两个版本共享相同提示接口,开发者无需修改代码即可在 Flash 和 Turbo 之间切换。
相关
- 项目
- 项目
- Dispatch
- 项目
- Dispatch