저자원 ASR을 위한 Wav2Vec2‑BERT 파인튜닝
Meta의 Wav2Vec2-BERT는 다목적 오디오 모델로, 저자원 언어에서 자동 음성 인식(ASR)을 위해 파인튜닝할 수 있으며, Whisper와 같은 자동회귀 모델에 대한 고성능 대안을 제공합니다. Connectionist Temporal Classification(CTC)을 활용함으로써, Wav2Vec2-BERT는 자원 부족 언어에서 Whisper-large-v3와 유사한 Word Error Rate(WER) 성능을 달성하면서도 10배에서 30배 빠르게 동작하고, 2.5배 더 효율적인 자원 사용을 보입니다.
Wav2Vec2-BERT 아키텍처 및 사전 학습
Wav2Vec2-BERT는 Meta의 Seamless Communication AI 번역 모델군을 위한 빌딩 블록으로 개발된 580M 파라미터 모델입니다. 이는 원래의 Wav2Vec2 모델을 크게 발전시킨 것으로, 저자원 전이 학습을 통한 ASR을 최초로 입증했습니다.
주요 사전 학습 통계는 다음과 같습니다:
- Data Volume: 라벨이 없는 오디오 데이터 4.5백만 시간에 대해 사전 학습되었습니다.
- Language Coverage: 143개 이상의 언어를 포괄합니다.
- Comparison: 이 규모는 XLS‑R(128개 언어에 50만 시간) 및 MMS(1,400개 이상의 언어에 50만 시간)보다 현저히 큽니다.
자동회귀 모델 대비 장점
Whisper는 ASR 분야에서 최첨단으로 널리 인정받고 있지만, "자원 부족" 언어(예: 몽골어, 말라얄람어)에서는 100%가 넘는 WER를 기록하는 등 특정 한계가 있습니다. 또한 Whisper의 자동회귀 특성은 특히 훈련 세트에 자주 등장하지 않는 언어에 대해 토큰을 더 많이 생성해야 하므로 본질적으로 느립니다.
반면 Wav2Vec2‑BERT는 한 번의 패스로 ASR을 예측합니다. 이 비자동회귀 접근 방식은 세 가지 주요 이점을 제공합니다:
- Inference Speed: Whisper‑large‑v3보다 10배에서 30배 빠릅니다.
- Resource Efficiency: 2.5배 더 효율적인 자원 사용을 보입니다.
- Adaptability: 어떤 알파벳에도 쉽게 적용 가능하며, 경쟁력 있는 성능을 얻기 위해 필요한 데이터 양이 최소화됩니다.
저자원 ASR을 위한 파인튜닝 파이프라인
facebook/w2v-bert-2.0 체크포인트를 몽골어와 같이 특정 언어에 맞추어 Common Voice 16.0 데이터셋을 사용해 적용하려면 다음 파이프라인을 사용합니다:
데이터 전처리
- Text Normalization: 전사 텍스트를 소문자로 변환하고, 음향 단위와 대응되지 않는 특수 문자(예: 구두점)를 제거합니다.
- Vocabulary Construction: 학습 및 테스트 세트에 등장하는 고유 문자들을 기반으로 어휘를 구축합니다. 몽골어 데이터셋에 포함된 라틴 문자와 같은 중복 문자는 어휘 크기를 줄이고 CTC 알고리즘에 유리하도록 제거합니다.
- Special Tokens: 어휘에는 단어 구분 토큰(
|), 알 수 없는 토큰([UNK]), 그리고 CTC 정렬에 필수적인 패딩/블랭크 토큰([PAD])이 포함됩니다. - Audio Processing: 원시 오디오를 16 kHz로 재샘플링하여 모델의 사전 학습 분포와 일치시킵니다.
기술 구현
- Feature Extraction:
SeamlessM4TFeatureExtractor가 원시 오디오 진폭 값을 로그‑멜 스펙트로그램으로 변환합니다. - Tokenizer:
Wav2Vec2CTCTokenizer가 문자 토큰과 레이블 ID 간 매핑을 담당합니다. - Training Objective: 모델은 Connectionist Temporal Classification(CTC)으로 파인튜닝되며, 이는 입력 시퀀스와 길이가 다른 출력 시퀀스를 명시적 정렬 없이 매핑할 수 있게 합니다.
학습 결과 및 스케일링 팁
약 14시간 분량의 검증된 학습 데이터를 사용해 몽골어 ASR에 대한 시연 파인튜닝을 수행한 결과, Wav2Vec2‑BERT는 Whisper‑large‑v3와 경쟁할 만한 Word Error Rate(WER)를 달성했습니다(Whisper‑large‑v3는 동일 작업에서 33.3% WER를 기록).
스케일링을 위한 전문가 팁
- Vocabulary Pruning: 데이터셋 라벨에 오류가 있어 손실 급등을 방지하려면 사용 빈도가 매우 낮은 문자를 제거합니다.
- Temporal Resolution: CTC 토큰당 이상적인 지속 시간은 10 ms에서 35 ms 사이입니다. 신호 청크가 너무 길면(예: 30‑60 ms) 손실 곡선이 폭발할 수 있습니다. 인코더 은닉 상태를 서브샘플링하는 컨볼루션 어댑터 레이어를 추가하면 해결됩니다.
- Under‑training 방지:
- 워밍업 비율을 5%~15%로 유지하고 에포크 수를 늘려 언어 모델 헤드 가중치가 사전 학습 모델과 정렬되도록 합니다.
- AdamW의 $\beta_{2}$를 0.95~0.98 사이로 조정해 손실 곡선을 부드럽게 합니다.