Apple SpeechAnalyzer ベンチマーク:Whisper および SFSpeechRecognizer とのパフォーマンス比較

Apple SpeechAnalyzer は Whisper Small と従来の API を上回り、オンデバイスの英語文字起こしで優位性を示す

Apple の新しい SpeechAnalyzer API は、テストされた中で最も正確なオンデバイス英語音声エンジンであり、クリーンおよびノイズ環境の両方で Whisper Small を上回り、約 3 倍速く動作します。また、前身の SFSpeechRecognizer と比較して、すべてのテストデータセットで Word Error Rate(WER)が大幅に低減されており、飛躍的な進歩を示しています。

パフォーマンスベンチマーク

Apple M2 Pro(32GB、macOS 26.5.1)上で LibriSpeech データセットを使用してテストした結果、SpeechAnalyzer が最も低い Word Error Rate(WER)を示し、数値が低いほど精度が高いことを示しています。

エンジン test-clean WER test-other WER モデルサイズ
Apple SpeechAnalyzer (iOS/macOS 26) 2.12% 4.56% system
Whisper Small (WhisperKit CoreML) 3.74% 7.95% ~460MB
Whisper Base 5.42% 12.51% ~140MB
Whisper Tiny 7.88% 17.04% ~40MB
Apple SFSpeechRecognizer (legacy) 9.02% 16.25% system

SFSpeechRecognizer から SpeechAnalyzer への移行

開発者はレガシーの SFSpeechRecognizer から直ちに SpeechAnalyzer へ移行すべきです。新しい API は同じ音声に対して WER を 3.5 倍〜4 倍削減します。具体的には、クリーン音声の WER が 9.02% から 2.12% に、ノイズ音声の WER が 16.25% から 4.56% に低下しました。単なる精度向上にとどまらず、SpeechAnalyzer はレガシーエンジンの粗い出力に比べ、句読点や大文字小文字が適切に付与されたテキストを生成します。

SpeechAnalyzer と OpenAI Whisper の比較

現在の Apple ハードウェア上での英語文字起こしにおいて、SpeechAnalyzer は最も強力なオンデバイスオプションとなり、Whisper Small を十分なマージンで上回り、音声 1 秒あたりの計算時間は Whisper の約 1/3 です。

それでも Whisper には以下の 2 つの主な利点があります:

  1. 言語サポート: Whisper ははるかに多くの言語をカバーしているのに対し、SpeechAnalyzer は約 30 のロケールをサポートします。
  2. プラットフォーム非依存性: Whisper はさまざまなプラットフォームで動作しますが、SpeechAnalyzer は OS 26 以降の Apple プラットフォームに限定されます。

速度と効率性

テストされたすべてのエンジンは M2 Pro 上でリアルタイムより速く動作し、文字起こし速度は 12 倍から 40 倍の範囲でした。SpeechAnalyzer は Whisper Small に比べ、音声 1 秒あたり約 3 倍速く処理します。

技術的手法と検証

ベンチマークの妥当性を確保するため、以下のコントロールを実装しました:

  • 再現性: Whisper の結果を OpenAI が公開している LibriSpeech の数値と比較し、CoreML 量子化と厳格なテキスト正規化に起因する小さな正のオフセットが一貫していることを確認しました。
  • 本番コードパス: エンジンは実際の本番コードを通して実行し、ラボ用ハーネスではなく実際の使用状況を模倣しました。
  • テキスト正規化: すべての出力は正規化(大文字小文字、句読点、数字→単語変換)を通過させ、フォーマットの違いでエンジンがペナルティを受けないようにしました。
  • オンデバイス検証: ハーネスはクラウド認識にフォールバックした場合に実行を拒否するよう設定し、すべての結果が厳密にオンデバイスで得られたことを保証しました。

開発者とユーザーの洞察

コミュニティのフィードバックと開発者レポートは、SpeechAnalyzer API の実用的な利点と制限を以下のように示しています:

  • ストリーミング機能: 多くのモデルが全録音が完了してから文字起こしを行うのに対し、SpeechAnalyzer はストリーミングをサポートし、リアルタイムで結果を表示できます。
  • アプリバンドルサイズ: モデルがシステムに組み込まれているため、開発者はアプリにモデルを同梱する必要がなく、最終的なアプリサイズを削減できます。
  • 言語管理: API はロケールをオンデマンドリソースとして扱うためディスク容量は節約できますが、言語ごとに別々のモデルダウンロードが必要となり、事前に使用言語が分からないマルチリンガル音声の文字起こしが難しくなります。
  • 大規模モデルとの比較: 一部ユーザーは、SpeechAnalyzer は高速であるものの、Whisper Large‑V2 のような大規模モデルが特定のユースケース(例:数学講義)では若干精度が高いと報告しています。

"SpeechAnalyzer はほぼ常に多様な音声を正しく処理します。固有名詞に苦戦することがありますが、音韻的に類似したものを返します。私の主な不満は、言語ごとに別々のモデルダウンロードが必要な点です。"

本調査の制限

  • 言語範囲: ベンチマークは英語に限定されており、Whisper がサポートする 100 以上の言語は考慮されていません。
  • 音声タイプ: LibriSpeech コーパスは朗読オーディオブックの音声であり、アクセントの強い音声、遠距離マイク、複数話者の会議環境での性能とは異なる可能性があります。
  • ハードウェア: 結果は単一の M2 Pro マシンで生成されました。精度は Apple Silicon 全体で一貫すると見込まれますが、速度はチップごとに変動します。

SUMMARY: Apple の SpeechAnalyzer API は、macOS および iOS 26 上で、英語のオンデバイス文字起こしにおいて、Whisper Small と従来の SFSpeechRecognizer を精度と速度の両面で上回ります。

TITLE: Apple SpeechAnalyzer ベンチマーク:Whisper および SFSpeechRecognizer とのパフォーマンス比較

Sources

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch
  • Dispatch