AudarAI/Audar-ASR-V1

Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

何を解決するか

Audar-ASR-V1 は、アラビア語の方言(ガルフ/アラブ首長国連邦、エジプト、レバノン・シリア、マグレブなど)およびアラビア語-英語のコードスイッチング音声に対して、高精度な音声認識(音声からテキストへの変換)を提供します。一般的なASRシステムよりも、これらの特定の言語的特徴に対して優れた性能を発揮することを目指しています。

仕組み

このプロジェクトは、音声認識を「音声条件付き次のトークン予測」として扱う生成型アプローチを採用しています。オープンウェイトの音声LLMを基盤とし、30万時間以上のラベル付き音声データを用いて適応させています。トレーニングプロセスは4段階のカリキュラムを経て、ネイティブのアラビア語ネイティブのアノテーターによるKTO好みの調整で終了します。

アーキテクチャ的には、Whisperスタイルの128メル音声エンコーダーとQwen3デコーダーを組み合わせています。2つのレベルで提供されています:

  • Flash:小型でリアルタイム対応のモデル(0.78Bパラメータ)で、エッジやデバイス内での使用に最適。
  • Turbo:より大きなモデル(2.35Bパラメータ)で、困難な方言や長時間音声に対応する高精度モデル。

対象ユーザー

アラビア語の方言や英語を含む音声を高精度で変換する必要がある開発者向け。音声エージェント、ライブ字幕サービス、30言語をカバーするアプリケーションの開発に適しています。

主な特徴

  • 最先端のパフォーマンス:Turbo レベルで「Open Universal Arabic ASR Leaderboard」で1位を獲得。
  • 方言に忠実:主要なアラビア語方言およびコードスイッチングに特化して最適化。
  • 柔軟なデプロイ:Hugging Face Transformers、GGUF(llama.cpp経由)、vLLM(GPUサーバー用)など、複数のランタイムをサポート。
  • ストリーミング対応:「LocalAgreement-2」ポリシーを実装し、250ms未満の遅延で安定した段階的出力を実現。
  • 効率的なスケーリング:両モデルは同じプロンプトインターフェースを共有しており、コード変更なしでFlashとTurboの切り替えが可能。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch