Qwen3-ASR 與 Qwen3-ForcedAligner 發布

Qwen 已開源 Qwen3‑ASR 與 Qwen3‑ForcedAligner 系列模型,推出高效能的多語言語音辨識與精確時間戳對齊工具。這些模型利用 Qwen3‑Omni 基礎模型的音訊理解能力,提供跨數十種語言與方言的穩健轉錄與對齊。

Qwen3-ASR:多語言語音辨識

Qwen3‑ASR 包含兩個全功能模型,Qwen3‑ASR‑1.7BQwen3‑ASR‑0.6B,將語言辨識與自動語音辨識(ASR)整合於單一流程中。

主要功能與語言支援

兩個模型皆支援 30 種語言與 22 種中文方言,包含來自各國與地區的英語口音。支援的語言包括中文 (zh)、英語 (en)、粵語 (yue)、阿拉伯語 (ar)、德語 (de)、法語 (fr)、西班牙語 (es)、葡萄牙語 (pt)、印尼語 (id)、義大利語 (it)、韓語 (ko)、俄語 (ru)、泰語 (th)、越南語 (vi)、日語 (ja)、土耳其語 (tr)、印地語 (hi)、馬來語 (ms)、荷蘭語 (nl)、瑞典語 (sv)、丹麥語 (da)、芬蘭語 (fi)、波蘭語 (pl)、捷克語 (cs)、菲律賓語 (fil)、波斯語 (fa)、希臘語 (el)、匈牙利語 (hu)、馬其頓語 (mk) 與羅馬尼亞語 (ro)。

效能與基準測試

Qwen3‑ASR‑1.7B 定位為高效能變體,在開源 ASR 模型中取得最先進(SOTA)成果,且與專有商業 API 仍具競爭力。

  • 英語: 在涵蓋 16 個國家口音的內部測試集上,優於 GPT‑4o Transcribe、Gemini 系列、Doubao ASR 與 Whisper‑large‑v3。
  • 多語言: 在 20 種主要語言上超越現有開源模型,取得最佳平均字詞錯誤率(WER)。
  • 中文與方言: 在普通話、粵語以及 22 種區域方言上領先商業 API 與開源模型。
  • 韌性: 在具挑戰性的情境下(如兒童或老人語音、以及極低訊噪比(SNR)環境)仍保持低字元/詞錯誤率。
  • 歌唱聲音: 支援帶背景音樂(BGM)的中文與英文完整歌曲轉錄,平均 WER 分別為 13.91%(中文)與 14.60%(英文)。

效率與吞吐量

Qwen3‑ASR‑0.6B 為準確度與效率的取捨進行了最佳化。在線非同步模式下,併發度為 128 時,能在 1 秒內轉錄 2,000 秒的語音(相當於 5 小時語音),且首次 token 的產生時間低至 92 毫秒。

Qwen3-ForcedAligner:精確時間戳預測

Qwen3‑ForcedAligner‑0.6B 是一個非自回歸(NAR)LLM 為基礎的時間戳預測器,旨在對齊文字與語音對。

技術規格

  • 語言支援: 支援 11 種語言。
  • 容量: 能對最長 5 分鐘的語音中任意單位預測時間戳。
  • 效能: 在時間戳精度、語言覆蓋範圍與支援音訊長度方面,優於基於端到端(E2E)的對齊模型,如 Nemo‑Forced‑Aligner、WhisperX 與 Monotonic‑Aligner。

部署與框架

為了促進社群採用,Qwen 已在 Apache 2.0 授權下釋出完整的推論‑微調框架。此工具組支援:

  • 基於 vLLM 的批次推論
  • 非同步服務
  • 串流推論
  • 時間戳預測
  • 使用單一模型統一離線與串流推論
  • 對單一長音訊檔(最長 20 分鐘)進行轉錄

Sources