OpenAI Whisper リリース

OpenAIはWhisperを導入しました。Whisperは多様な音声環境において高いロバスト性を実現するよう設計された自動音声認識(ASR)システムです。ウェブから収集した多言語・マルチタスクの教師ありデータ680,000時間という大規模データセットで学習することで、背景ノイズやさまざまなアクセント、専門用語がある状況でも文字起こし精度が向上します。

アーキテクチャと技術実装

WhisperはシンプルなエンドツーエンドのエンコーダーデコーダーTransformerアーキテクチャを採用しています。処理パイプラインは以下の手順で進みます:

  1. Audio Processing: 入力音声は30秒のチャンクに分割されます。
  2. Feature Extraction: これらのチャンクはログメルスペクトログラムに変換されます。
  3. Encoding: スペクトログラムはエンコーダーに通されます。
  4. Decoding: デコーダーが対応するテキストキャプションを予測します。

単一モデルで複数のタスクを処理するために、Whisperは特殊トークンを使用します。これらのトークンは、言語識別、フレーズレベルのタイムスタンプ、多言語音声文字起こし、非英語音声の英語への翻訳など、特定の機能をモデルに指示します。

パフォーマンスとロバスト性

Whisperの主な強みは、狭い専門的ベンチマークでの性能よりも、汎用的なロバスト性にあります。

  • Zero-Shot Performance: 多様なデータセットで測定した場合、Whisperは小規模で音声とテキストが密接にペアになったデータで訓練されたモデルよりもはるかに高いロバスト性を示し、ゼロショットシナリオでエラーが50%減少します。
  • Specialized Benchmarks: 特定のデータセット向けにファインチューニングされていないため、WhisperはLibriSpeechの性能に特化したモデルを上回ることはありません。
  • Multilingual Capabilities: 訓練データの約3分の1は英語以外です。これにより、元の言語の文字起こしと英語への翻訳の両方でモデルは優れた性能を発揮します。ゼロショットテストでは、WhisperはCoVoST2から英語への翻訳において、教師あり最先端(SOTA)を上回ります。

オープンソースでの提供

音声インターフェースの開発とロバストな音声処理に関するさらなる研究を支援するため、OpenAIはWhisperモデルとそれに付随する推論コードをオープンソース化しました。

Sources