저자원 자동 음성 인식(ASR)을 위한 XLS-R 미세 조정
저자원 자동 음성 인식(ASR)을 위한 XLS-R 미세 조정(Fine-Tuning)\n\nHugging Face는 저자원 언어의 자동 음성 인식(ASR)을 위해 XLSR의 후속 모델인 XLS-R을 미세 조정하는 과정을 상세히 설명했습니다. 128개 언어에 대한 자기 지도 사전 학습(self-supervised pre-training)을 활용함으로써, XLS-R은 개발자가 제한된 레이블링된 학습 데이터만으로도 기능적인 음성-텍스트 변환 기능을 구현할 수 있도록 합니다.\n\n## XLS-R 모델 아키텍처 및 사전 학습\n\nXLS-R은 여러 언어에 걸쳐 효과적인 교차 언어 음성 표현을 학습하도록 설계되었습니다. 128개 언어에 걸친 약 500,000시간의 오디오 데이터를 사용하여 사전 학습되었습니다. 모델은 3억, 10억, 20억 개의 파라미터 크기의 세 가지 버전으로 제공됩니다.\n\n### 자기 지도 학습 목표\n\nBERT의 마스크 언어 모델링(masked language modeling)과 유사하게, XLS-R은 자기 지도 사전 학습 단계에서 트랜스포머 네트워크를 통과시키기 전에 특징 벡터를 무작위로 마스킹하여 문맥화된 음성 표현을 학습합니다.\n\n### 미세 조정 메커니즘\n\n음성 인식, 음성 번역 또는 오디오 분류와 같은 다운스트림 태스크를 위해 사전 학습된 네트워크를 조정하려면, 트랜스포머 블록 위에 단일 선형 레이어를 추가합니다. 이 레이어는 대상 레이블링된 데이터셋의 어휘집(vocabulary)을 기반으로 문맥 표현을 특정 토큰 클래스로 매핑합니다.\n\n## ASR을 위한 기술적 구현\n\nASR을 위한 XLS-R 미세 조정에는 모델이 오디오 신호를 텍스트로 정확하게 매핑할 수 있도록 보장하는 몇 가지 중요한 전처리 및 아키텍처 단계가 포함됩니다.\n\n### 데이터 전처리 및 토큰화\n\nASR을 위해서는 두 가지 주요 구성 요소가 필요합니다:\n1. Wav2Vec2FeatureExtractor: 원시 음성 신호를 모델의 입력 형식으로 처리합니다. XLS-R은 16kHz로 샘플링된 오디오를 필요로 합니다. 소스 데이터(예: Common Voice)가 더 높은 비율로 샘플링된 경우(예: 48kHz), 다운샘플링을 수행해야 합니다.\n2. Wav2Vec2CTCTokenizer: 모델의 출력을 텍스트로 매핑합니다. 어휘집은 단어 구분자 토큰( | 로 표시됨)과 CTC 알고리즘에 필요한 특수
관련
- Dispatch
저자원 ASR을 위한 MMS 어댑터 모델 미세 조정하기Hugging Face는 Meta AI의 Massive Multilingual Speech (MMS) 모델에 어댑터 레이어를 미세 조정하는 것이 단 몇 분의 학습만으로 저자원 언어에 대해 최첨단 단어 오류율(WER)을 사용하여, 전체 모델 미세 조정보다 메모리 효율적임을 발표했습니다.
- Dispatch
저자원 ASR을 위한 Wav2Vec2‑BERT 파인튜닝Hugging Face는 Meta의 Wav2Vec2‑BERT 모델을 저자원 언어의 자동 음성 인식(ASR)용으로 파인튜닝하는 방법을 보여주며, Whisper‑large‑v3와 비슷한 성능을 달성하면서도 훨씬 빠르고 자원 효율이 높다는 점을 입증합니다.
- Dispatch
- Dispatch