OpenAI Whisper 릴리스

OpenAI는 Whisper를 도입했습니다. Whisper는 다양한 오디오 환경에서 높은 견고성을 제공하도록 설계된 자동 음성 인식(ASR) 시스템입니다. 웹에서 수집한 다국어 및 다중 작업 감독 데이터 68만 시간의 방대한 데이터셋으로 학습함으로써, Whisper는 배경 소음, 다양한 억양 및 전문 용어가 있는 상황에서도 전사 정확도를 향상시킵니다.

아키텍처 및 기술 구현

Whisper는 간단한 엔드투엔드 인코더-디코더 Transformer 아키텍처를 활용합니다. 처리 파이프라인은 다음 단계로 구성됩니다:

  1. 오디오 처리: 입력 오디오는 30초 길이의 청크로 나뉩니다.
  2. 특징 추출: 이러한 청크는 로그-Mel 스펙트로그램으로 변환됩니다.
  3. 인코딩: 스펙트로그램은 인코더를 통과합니다.
  4. 디코딩: 디코더는 해당 텍스트 캡션을 예측합니다.

단일 모델 내에서 다중 작업을 처리하기 위해 Whisper는 특수 토큰을 사용합니다. 이러한 토큰은 모델에게 언어 식별, 구절 수준 타임스탬프, 다국어 음성 전사, 비영어 음성을 영어로 번역하는 등 특정 기능을 수행하도록 지시합니다.

성능 및 견고성

Whisper의 주요 강점은 좁고 특화된 벤치마크에서의 성능보다 일반적인 견고성에 있습니다.

  • 제로샷 성능: 다양한 데이터셋에서 측정했을 때, Whisper는 소규모의 밀접하게 짝지어진 오디오-텍스트 데이터셋으로 학습된 모델보다 현저히 높은 견고성을 보여주며, 제로샷 상황에서 오류가 50% 적게 발생합니다.
  • 특화된 벤치마크: 특정 데이터셋에 대해 미세 조정되지 않았기 때문에, Whisper는 LibriSpeech 성능에 특화된 모델보다 뛰어나지 않습니다.
  • 다국어 능력: 학습 데이터의 약 3분의 1은 비영어입니다. 이를 통해 모델은 원본 언어를 전사하고 영어로 번역하는 데 모두 뛰어납니다. 제로샷 테스트에서 Whisper는 CoVoST2에서 영어 번역에 대한 감독된 최신 기술(SOTA)을 능가합니다.

오픈 소스 제공

음성 인터페이스 개발 및 견고한 음성 처리에 대한 추가 연구를 지원하기 위해, OpenAI는 Whisper 모델과 관련 추론 코드를 오픈소스로 공개했습니다.

Sources