AudarAI/Audar-ASR-V1
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
解決的問題
Audar-ASR-V1 提供高精度的阿拉伯語語音轉文字轉錄,特別針對阿拉伯語方言(如海灣/阿聯酋、埃及、黎凡特及馬格里布方言)以及阿拉伯語-英語混用語音的挑戰。其目標是在這些特定語言特徵上超越通用語音辨識系統的表現。
工作原理
本專案採用生成式語音辨識方法,將轉錄視為音訊條件下的下一個詞元預測。基於開源權重的音訊大語言模型(audio-LLM)基礎,並利用超過30萬小時的標註音訊資料進行適配。訓練過程包含四階段課程,最終透過母語阿拉伯語標註員的 KTO 偏好對齊完成。
在架構上,採用 Whisper 風格的 128-mel 音訊編碼器,搭配 Qwen3 解碼器。提供兩個版本:
- Flash:小型即時模型(0.78B 參數),適用於邊緣裝置與本地部署。
- Turbo:更大、更精確的模型(2.35B 參數),適用於複雜方言與長音訊。
適用對象
開發語音代理、即時字幕服務,以及需要高精度轉錄阿拉伯語方言與英語的應用程式的開發者,支援總計 30 種語言。
主要亮點
- 業界領先性能:Turbo 版本在 Open Universal Arabic ASR Leaderboard 上排名第一。
- 方言忠實:專門針對主要阿拉伯語方言與代碼切換場景進行優化。
- 靈活部署:支援多種執行環境,包括 Hugging Face Transformers、GGUF(透過 llama.cpp)、vLLM(GPU 服務)。
- 串流處理能力:採用「LocalAgreement-2」策略,實現穩定、增量式輸出,延遲低於 250ms。
- 高效擴展:兩個版本共享相同提示介面,開發者無需修改程式碼即可在 Flash 和 Turbo 之間切換。
相關
- 專案
- 專案
- Dispatch
- 專案
- Dispatch