Hugging Face 开放 ASR 排行榜趋势与洞察

Hugging Face 为开放 ASR 排行榜引入了新的多语言和长文本转录轨道,以提供对短文本英语转录之外的自动语音识别(ASR)模型的更全面评估。截至 2025 年 11 月 21 日,该排行榜比较了来自 18 个组织的 60 多个开源和闭源模型,覆盖 11 个数据集。

英文准确率:Conformer 编码器和 LLM 解码器

将 Conformer 编码器与大型语言模型(LLM)解码器相结合的模型目前在英语转录中达到最高准确率。此类别的领先模型包括 NVIDIA 的 Canary-Qwen-2.5B、IBM 的 Granite-Speech-3.3-8B 和 Microsoft 的 Phi-4-Multimodal-Instruct,它们都表明集成 LLM 推理能够显著降低词错误率(WER)。

为了在此架构中提高效率,NVIDIA 使用了“快速 Conformer”,这是一种比标准 Conformer 快两倍的变体,用于 Canary 和 Parakeet 模型套件。

速度与准确率的权衡

虽然基于 LLM 的解码器提供更高的准确率,但它们通常比更简单的架构慢。排行榜使用逆实时因子(RTFx)来衡量效率,数值越高表示性能越好。

对于需要高吞吐量的应用——例如实时转录、讲座的离线批处理或播客——CTC 和 TDT 解码器是最佳选择。这些解码器提供的吞吐量比基于 LLM 的替代方案快 10–100 倍,尽管它们会导致略微更高的错误率。

多语言性能与专业化

存在一种已文档化的权衡,即一般多语言能力与单语言专业化之间的权衡。OpenAI 的 Whisper Large v3 仍然是一个支持 99 种语言的强基线,但像 Distil-Whisper 和 CrisperWhisper 这样的蒸馏或微调变体在仅英语任务上往往优于原始模型。

关于多语言 ASR 的关键观察包括:

  • 专业化权衡: 专注于英语性能通常会降低模型的多语言覆盖。
  • 自监督系统: Meta 的 Massively Multilingual Speech (MMS) 和 Omnilingual ASR 支持超过 1,000 种语言,但在准确率方面落后于特定语言的编码器。
  • 本地化基准: 社区驱动的工作已扩展到特定语言的排行榜,例如开放通用阿拉伯 ASR 排行榜(涵盖现代标准阿拉伯语和地方方言)和俄罗斯 ASR 排行榜。

长文本转录挑战

闭源系统目前在长音频转录(例如会议和播客)方面保持性能领先,这可能归因于自定义分块、生产级优化或领域调优。

在开源选项中,OpenAI 的 Whisper Large v3 在准确率方面表现最佳。然而,就吞吐量而言,基于 CTC 的 Conformer 显著更高效。例如,NVIDIA 的 Parakeet CTC 1.1B 的 RTFx 为 2793.75,而 Whisper Large v3 的 RTFx 为 68.56,词错误率(WER)仅中等增加(6.68 对比 6.43)。值得注意的是,Parakeet 仅限于英语,这进一步说明了多语言支持与专业性能之间的权衡。

Sources