AudarAI/Audar-ASR-V1

Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

解決的問題

Audar-ASR-V1 提供高精度的阿拉伯語語音轉文字轉錄,特別針對阿拉伯語方言(如海灣/阿聯酋、埃及、黎凡特及馬格里布方言)以及阿拉伯語-英語混用語音的挑戰。其目標是在這些特定語言特徵上超越通用語音辨識系統的表現。

工作原理

本專案採用生成式語音辨識方法,將轉錄視為音訊條件下的下一個詞元預測。基於開源權重的音訊大語言模型(audio-LLM)基礎,並利用超過30萬小時的標註音訊資料進行適配。訓練過程包含四階段課程,最終透過母語阿拉伯語標註員的 KTO 偏好對齊完成。

在架構上,採用 Whisper 風格的 128-mel 音訊編碼器,搭配 Qwen3 解碼器。提供兩個版本:

  • Flash:小型即時模型(0.78B 參數),適用於邊緣裝置與本地部署。
  • Turbo:更大、更精確的模型(2.35B 參數),適用於複雜方言與長音訊。

適用對象

開發語音代理、即時字幕服務,以及需要高精度轉錄阿拉伯語方言與英語的應用程式的開發者,支援總計 30 種語言。

主要亮點

  • 業界領先性能:Turbo 版本在 Open Universal Arabic ASR Leaderboard 上排名第一。
  • 方言忠實:專門針對主要阿拉伯語方言與代碼切換場景進行優化。
  • 靈活部署:支援多種執行環境,包括 Hugging Face Transformers、GGUF(透過 llama.cpp)、vLLM(GPU 服務)。
  • 串流處理能力:採用「LocalAgreement-2」策略,實現穩定、增量式輸出,延遲低於 250ms。
  • 高效擴展:兩個版本共享相同提示介面,開發者無需修改程式碼即可在 Flash 和 Turbo 之間切換。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • Dispatch