Qwen3-ASR 和 Qwen3-ForcedAligner 发布

Qwen 已开源 Qwen3-ASR 和 Qwen3-ForcedAligner 模型系列,推出高性能的多语言语音识别和精确时间戳对齐工具。这些模型利用 Qwen3-Omni 基础模型的音频理解能力,实现对数十种语言和方言的稳健转录与对齐。

Qwen3-ASR:多语言语音识别

Qwen3-ASR 包含两个一体化模型,Qwen3-ASR-1.7BQwen3-ASR-0.6B,将语言识别与自动语音识别(ASR)合并到同一流水线中。

关键能力与语言支持

两款模型均支持 30 种语言和 22 种中文方言,包括来自不同国家和地区的英语口音。支持的语言包括中文(zh)、英语(en)、粤语(yue)、阿拉伯语(ar)、德语(de)、法语(fr)、西班牙语(es)、葡萄牙语(pt)、印尼语(id)、意大利语(it)、韩语(ko)、俄语(ru)、泰语(th)、越南语(vi)、日语(ja)、土耳其语(tr)、印地语(hi)、马来语(ms)、荷兰语(nl)、瑞典语(sv)、丹麦语(da)、芬兰语(fi)、波兰语(pl)、捷克语(cs)、菲律宾语(fil)、波斯语(fa)、希腊语(el)、匈牙利语(hu)、马其顿语(mk)和罗马尼亚语(ro)。

性能与基准

Qwen3-ASR-1.7B 定位为高性能变体,在开源 ASR 模型中实现了业界领先(SOTA)水平,并且在与商业闭源 API 的竞争中保持优势。

  • 英语: 在覆盖 16 个国家口音的内部测试集上,超越 GPT-4o Transcribe、Gemini 系列、豆包 ASR 和 Whisper-large-v3。
  • 多语言: 在 20 种主流语言上超越现有开源模型,取得最佳平均词错误率(WER)。
  • 中文及方言: 在普通话、粤语以及 22 种地区方言上领先商业 API 与开源模型。
  • 鲁棒性: 在儿童或老年人语音、以及极低信噪比(SNR)环境等挑战场景下保持低字符/词错误率。
  • 歌唱语音: 支持带背景音乐(BGM)的中英文整曲转录,平均 WER 分别为 13.91%(中文)和 14.60%(英文)。

效率与吞吐量

Qwen3-ASR-0.6B 针对精度‑效率平衡进行优化。在并发度为 128 的在线异步模式下,能够在 1 秒内转录 2,000 秒的音频(相当于 5 小时语音),并实现首 token 响应时间低至 92 ms。

Qwen3-ForcedAligner:精确时间戳预测

Qwen3-ForcedAligner-0.6B 是一种基于大语言模型的非自回归(NAR)时间戳预测器,专用于对齐文本‑语音对。

技术规格

  • 语言支持: 支持 11 种语言。
  • 容量: 可为最长 5 分钟的语音中的任意单元预测时间戳。
  • 性能: 在时间戳精度、语言覆盖范围和支持的音频时长方面,均优于基于端到端(E2E)的强制对齐模型,如 Nemo-Forced-Aligner、WhisperX 和 Monotonic-Aligner。

部署与框架

为促进社区使用,Qwen 发布了基于 Apache 2.0 许可证的完整推理‑微调框架。该工具包支持:

  • 基于 vLLM 的批量推理
  • 异步服务
  • 流式推理
  • 时间戳预测
  • 使用单一模型实现统一的离线与流式推理
  • 对单个最长 20 分钟的长音频文件进行转录

Sources