低リソースASR向けMMSアダプターモデルのファインチューニング

TL;DR

Hugging Faceは、MMS‑1Bチェックポイントのアダプターレイヤーのみをファインチューニングすることで、約4時間のCommon Voiceデータでのわずか10‑20分のトレーニング後に強力なトルコ語音声認識を達成できることを示しています。これは、フルモデルのファインチューニングに比べてはるかに少ないトレーニング可能なパラメータを使用します。

世界の言語多様性の保存

MMSは、小さなアダプターレイヤーを使用して言語間の言語的ブリッジとして機能させることにより、1,100以上の言語(そのうち多くは危機に瀕している)の転写をサポートします。

MMSのファインチューニング概要

MMS‑1Bチェックポイントは、1,400以上の言語にわたる50万時間以上の音声で事前学習され、その後、共通の語彙出力層を持つ1,000以上の言語でファインチューニングされました。この出力層は、それぞれ約2.5Mの重みを含む言語固有のアダプターレイヤーに置き換えられました。 ASR向けのチェックポイントが3つ利用可能です:mms-1b-fl102mms-1b-l1107、およびmms-1b-all

アダプティブウェイトのトレーニング – アダプターが役立つ理由

アダプターレイヤーは、凍結されたトランスフォーマーブロックの間に小さなトレーニング可能なモジュールを挿入し、事前学習された重みの大部分を更新せずに、言語固有の音声および文法的特性を獲得できるようにします。このアプローチは、メモリ使用量を削減し、収束を速め、低リソースデータでのオーバーフィッティングを防ぎます。

ノートブックのセットアップ – データと前処理

このノートブックは、Common Voice 6.1のトルコ語スプリット(約4時間の検証済みトレーニング音声)を使用します。音声は16 kHzにリサンプリングされ、特殊文字は削除され、テキストは小文字に変換され、トルコ語特有のダイアクリティカルマークは正規化されます。トランスクリプトから37トークン(スペース、句読点、[UNK]、および[PAD]を含む)の語彙が構築され、ISO‑639‑3コード tur の下に保存されます。 Wav2Vec2Processorは、Wav2Vec2FeatureExtractor(feature_size=1、sampling_rate=16000、padding_value=0.0、do_normalize=True、return_attention_mask=True)とカスタムトークナイザーを組み合わせます。

トレーニングプロセスと結果

トレーニングでは、入力値とラベルを別々にパディングし、ラベルのパディングを‑100でマスクし、評価指標として単語誤り率(WER)を使用するカスタム DataCollatorCTCWithPadding を使用します。 モデルは facebook/mms-1b-all からロードされ、ドロップアウトレイヤーは無効にされ、語彙サイズは37に設定され、サイズの不一致は無視されます(新しく初期化されたLMヘッドが新しい語彙に一致します)。 アダプターレイヤーは(再)初期化され、ベースモデルは凍結され、アダプターウェイトのみが勾配を受け取ります。 トレーニング引数: group_by_length=Trueper_device_train_batch_size=32num_train_epochs=4learning_rate=1e-3gradient_checkpointing=Truefp16=Truesave_steps=200eval_steps=100logging_steps=100push_to_hub=True。 100トレーニングステップ後の検証WERは0.280で、200ステップ後に0.232に低下し、300ステップで0.229、400ステップで0.223となりました。トレーニング損失は同じ期間で4.905から0.2398に減少しました。 これらの結果は、同じ低リソーストルコ語データにおいて、アダプターのみのファインチューニングが、より小さなXLS‑R‑300Mチェックポイントのフルモデルファインチューニングよりも優れていることを示しており、さらにメモリ効率も高いです。

ファインチューニング済みアダプターのロードと使用

トレーニング後、アダプターウェイトはベースモデルとともに adapter.tur.safetensors として保存されます。推論を行うには、チェックポイントを `target_lang=

Sources