Hugging Face Open ASR 排行榜趨勢與見解

Hugging Face 已為 Open ASR 排行榜新增多語言與長格式轉錄軌道,以提供比僅限英文短格式轉錄更全面的自動語音識別(ASR)模型評估。截至 2025 年 11 月 21 日,排行榜比較了來自 18 個組織的超過 60 個開放與閉源模型,涵蓋 11 個資料集。

英文準確度:Conformer 編碼器與 LLM 解碼器

結合 Conformer 編碼器與大型語言模型(LLM)解碼器的模型目前在英文轉錄上達到最高準確度。此類別的領先模型包括 NVIDIA 的 Canary-Qwen-2.5B、IBM 的 Granite-Speech-3.3-8B 與 Microsoft 的 Phi-4-Multimodal-Instruct,它們都表明整合 LLM 推理能顯著降低詞錯誤率(WER)。

為提升此架構的效率,NVIDIA 使用「Fast Conformer」,這是標準 Conformer 的兩倍速變體,用於 Canary 與 Parakeet 模型系列。

速度與準確度的權衡

儘管基於 LLM 的解碼器提供更優的準確度,但它們通常比較簡單的架構慢。排行榜使用逆實時因子(RTFx)來衡量效率,數值越高表示效能越好。

對於需要高吞吐量的應用——例如即時轉錄、講座的離線批次處理或播客——CTC 與 TDT 解碼器是最佳選擇。這些解碼器提供的吞吐量比基於 LLM 的替代方案快 10–100 倍,儘管它們會導致略微較高的錯誤率。

多語言表現與專業化

一般多語言能力與單語專業化之間存在有文件記錄的權衡。OpenAI 的 Whisper Large v3 仍是支援 99 語言的強大基線,但經蒸餾或微調的變體,如 Distil-Whisper 與 CrisperWhisper,常在僅限英語的任務上優於原始模型。

關於多語言 ASR 的主要觀察包括:

  • 專業化權衡: 專注於英語表現通常會降低模型的多語言覆蓋範圍。
  • 自監督系統: Meta 的 Massively Multilingual Speech (MMS) 與 Omnilingual ASR 支援超過 1,000 語言,但在準確度方面仍落後於語言特定編碼器。
  • 在地化基準: 社區驅動的工作已擴展至語言特定排行榜,例如 Open Universal Arabic ASR Leaderboard(涵蓋現代標準阿拉伯語及區域方言)和 Russian ASR Leaderboard。

長格式轉錄挑戰

閉源系統目前在長格式音訊轉錄(例如會議與播客)上保持效能領先,這可能歸因於自訂分塊、生產級優化或領域調整。

在開源選項中,OpenAI 的 Whisper Large v3 在準確度方面表現最佳。然而,就吞吐量而言,基於 CTC 的 Conformer 顯著更高效。例如,NVIDIA 的 Parakeet CTC 1.1B 的 RTFx 為 2793.75,而 Whisper Large v3 的為 68.56,僅導致 WER 中等增加(6.68 對 6.43)。值得注意的是,Parakeet 僅限於英語,進一步說明了多語言支援與專業表現之間的權衡。

Sources