低リソース音声認識のためのXLS-Rファインチューニング

Hugging Faceは、XLSRの後継であるXLS-Rを低リソース言語向けのAutomatic Speech Recognition(ASR)にファインチューニングするプロセスを詳細に説明しています。128言語での自己教師ありプレトレーニングを活用することで、XLS-Rはラベル付きトレーニングデータが限られている場合でも開発者は機能的な音声からテキストへの変換機能を達成できます。

XLS-R Model Architecture and Pre-training

XLS-Rは、複数の言語で効果的なクロスリンガル音声表現を学習するように設計されています。128言語にわたるほぼ500,000時間の音声データでプレトレーニングされました。モデルは300百万、10億、20億パラメータの3つのサイズで利用可能です。

Self-Supervised Learning Objective

BERTのマスクド言語モデリングと同様に、XLS-Rは自己教師ありプレトレーニングフェーズ中にトランスフォーマーネットワークに通す前に特徴ベクトルをランダムにマスクすることで、コンテキスト化された音声表現を学習します。

Fine-Tuning Mechanism

音声認識、音声翻訳、または音声分類などのダウンストリームタスクにプリトレーニング済みネットワークを適応させるため、トランスフォーマーブロックの上に単一の線形レイヤーが追加されます。このレイヤーは、ターゲットラベル付きデータセットの語彙に基づいてコンテキスト表現を特定のトークンクラスにマッピングします。

Technical Implementation for ASR

XLS-RをASRにファインチューニングするには、モデルが音声信号をテキストに正しくマッピングすることを確実にするため、いくつかの重要な前処理とアーキテクチャ手順が必要です。

Data Preprocessing and Tokenization

ASRには、次の2つの主要コンポーネントが必要です:

  1. Wav2Vec2FeatureExtractor: 生の音声信号をモデルの入力形式に処理します。XLS-Rは16kHzでサンプリングされたオーディオを必要とします。ソースデータ(Common Voiceなど)がより高いレート(例えば48kHz)でサンプリングされている場合は、ダウンサンプリングする必要があります。
  2. Wav2Vec2CTCTokenizer: モデルの出力をテキストにマッピングします。語彙は、トレーニングおよびテストデータセットで見つかった異なる文字から構築され、単語区切りトークン(| で表現)とCTCアルゴリズムに必要な特殊な"blank token"が含まれます。

Connectionist Temporal Classification (CTC)

XLS-RはConnectionist Temporal Classification(CTC)を使用してファインチューニングされます。このアルゴリズムは、入力(音声信号)が出力(テキスト転写)よりもはるかに長いシーケンス間シーケンス問題に不可欠です。CTCは、音声フレームとテキスト文字の間の正確なアライメントを必要なく、モデルが文字を予測することを可能にします。

Training Configuration and Optimization

低リソースデータセット(例えば、約4時間の検証済みデータを含むCommon Voiceのトルコ語サブセットなど)でのファインチューニングには、安定性を維持するための特定の最適化戦略が必要です。

Model Setup

GPUメモリを最適化し、トレーニングの安定性を確保するため、以下の設定が推奨されます:

  • Feature Extractorの凍結: 音響特徴を抽出するCNNレイヤーは、プレトレーニング中に十分にトレーニングされているため、model.freeze_feature_extractor()で凍結されます。
  • Gradient Checkpointing: メモリ消費を削減するために有効にします。
  • Loss Reduction: CTC損失に対して"mean"に設定します。

Hyper-parameter Tuning

Common Voiceのようなクラウドソースデータセットに固有のノイズのため、ドロップアウト、SpecAugmentマスクドロップアウト率、学習率などのハイパーパラメータは慎重にチューニングする必要があります。提供されたデモンストレーションでは、学習率3e-4と30エポックが使用されました。

Training Efficiency

group_by_length=Trueを使用することで、同様の入力長のサンプルを同じバッチにグループ化し、必要なパディング量を最小限に抑えることでトレーニング効率が向上します。

Evaluation and Performance

モデルのパフォーマンスは、ASRの標準メトリックであるWord Error Rate(WER)で測定されます。Wav2Vec2-XLS-R-300Mチェックポイントを使用したトルコ語データでのデモンストレーションでは、トレーニング損失と検証WERが3,200ステップを通じて着実に減少し、約0.3195のWERに達しました。

Sources

関連