xzf-thu/Mega-ASR
First foundation ASR built for the real world - 7 atomic acoustic conditions, 54 compound scenarios, 2.6M samples, and up to ~30% gains over SOTA where every other model falls apart. **You'll come back to MEGA-ASR, after the rest fail in the wild. ⭐**
해결하는 문제
Mega-ASR는 '실제 환경'에서 표준 자동 음성 인식(ASR) 모델이 실패하는 문제를 해결합니다. 대부분의 모델은 배경 소음, 에코, 전자적 왜곡과 같은 실제 환경의 음향 도전 과제에 직면했을 때 높은 단어 오류율(WER) 또는 완전히 빈 출력을 초래하는 경우가 많습니다.
작동 방식
이 프로젝트는 실제 환경의 음향 시뮬레이션을 확장하여 견고한 기반 모델을 구축합니다. 7개의 원자적 음향 조건과 54개의 복합 시나리오를 포함하는 총 240만 개의 샘플로 훈련되었습니다. 포함된 내용은 다음과 같습니다:
- 노이즈와 원거리 음성
- 장애물과 리버버레이션
- 녹음 아티팩트와 전자적 왜곡
- 전송 손실
성능 최적화를 위해 A2S-SFT(교수형 미세조정) 및 DG-WGPO 기반 RL(강화학습)을 사용합니다.
대상 사용자
전통적인 최첨단 모델이 일반적으로 실패하는 도전적인 비스튜디오 음향 환경에서 고정밀 음성-텍스트 변환을 필요로 하는 개발자 및 연구자에게 적합합니다.
주요 특징
- 견고성: 전체 시나리오에 걸친 견고한 음성 인식을 특별히 타겟으로 합니다.
- 규모: 다양한 실제 환경 조건을 시뮬레이션하는 240만 개 샘플의 거대한 데이터셋으로 훈련되었습니다.
- 성능: 어려운 환경에서 최첨단 오픈소스 및 클로즈드소스 모델보다 최대 약 30% 향상된 성능을 달성합니다.
- 포괄적인 시뮬레이션: 원거리 음성에서 전송 손실에 이르기까지 다양한 음향 왜곡을 포괄합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트