Hugging Face Open ASR リーダーボードのトレンドと洞察
Hugging Face は、より包括的な短形式英語転写を超えた Automatic Speech Recognition (ASR) モデルの評価を提供するため、Open ASR リーダーボードに新しい多言語および長形式転写トラックを導入しました。2025年11月21日現在、リーダーボードは18の組織からの60以上のオープンおよびクローズドソースモデルを11のデータセットで比較しています。
英語精度: Conformer エンコーダと LLM デコーダ
Conformer エンコーダと大規模言語モデル (LLM) デコーダを組み合わせたモデルは、現在英語転写において最高の精度を達成しています。このカテゴリの主要なモデルには、NVIDIA の Canary-Qwen-2.5B、IBM の Granite-Speech-3.3-8B、Microsoft の Phi-4-Multimodal-Instruct が含まれ、これらはすべて LLM 推論を統合することで単語誤り率 (WER) を大幅に低減することを示しています。
このアーキテクチャの効率を向上させるため、NVIDIA は標準の Conformer の2倍の速度を持つバリアントである「Fast Conformer」を使用しています。これは Canary と Parakeet モデルスイートで使用されています。
速度と精度のトレードオフ
LLMベースのデコーダは優れた精度を提供しますが、一般的にはよりシンプルなアーキテクチャよりも遅いです。リーダーボードは逆リアルタイムファクター (RTFx) を使用して効率を測定し、値が高いほど性能が良いことを示します。
高スループットが必要なアプリケーション(リアルタイム転写、講義のオフラインバッチ処理、ポッドキャストなど)では、CTC と TDT デコーダが最適な選択肢です。これらのデコーダは、LLMベースの代替案と比較して10〜100倍高いスループットを提供しますが、わずかに高い誤差率をもたらします。
多言語パフォーマンスと専門性
一般的な多言語能力と単一言語の専門性の間には文書化されたトレードオフがあります。OpenAI の Whisper Large v3 は 99 言語をサポートする強力なベースラインのままですが、Distil-Whisper や CrisperWhisper などの蒸留またはファインチューンされたバリアントは、英語専用タスクにおいて元のモデルを上回ることがよくあります。
- 専門性のトレードオフ: 英語パフォーマンスに焦点を当てると、通常はモデルの多言語カバレッジが減少します。
- 自己教師ありシステム: Meta の Massively Multilingual Speech (MMS) と Omnilingual ASR は 1,000 以上の言語をサポートしますが、精度の面では言語固有のエンコーダに劣ります。
- ローカライズされたベンチマーク: コミュニティ主導の取り組みは、Open Universal Arabic ASR リーダーボード(Modern Standard Arabic と地方方言をカバー)や Russian ASR リーダーボードなどの言語固有のリーダーボードに拡大しています。
長形式転写の課題
クローズドソースシステムは、カスタムチャンク、本番レベルの最適化、またはドメインチューニングによるものと考えられますが、長形式の音声転写(会議やポッドキャストなど)において現在も性能のリードを維持しています。
オープンソースのオプションの中で、OpenAI の Whisper Large v3 は精度においてトップパフォーマーです。ただし、スループットについては、CTCベースの Conformer がはるかに効率的です。たとえば、NVIDIA の Parakeet CTC 1.1B は RTFx が 2793.75 で、Whisper Large v3 の 68.56 と比較しており、WER の増加は中程度のみ(6.68 vs 6.43)です。值得注意的是、Parakeet は英語のみに限定されており、多言語サポートと専門性能の間のトレードオフをさらに示しています。