SpeechT5: 통합 모달 인코더-디코더를 이용한 음성 처리

개요

SpeechT5는 단일 아키텍처 내에서 여러 음성 언어 처리 작업을 처리하도록 설계된 통합 모달 인코더-디코더 모델입니다. 텍스트-음성, 음성-텍스트, 텍스트-텍스트, 그리고 음성-음성 데이터의 혼합을 사전 학습함으로써, 모델은 텍스트와 음성 모두가 공유하는 통합된 은닉 표현 공간을 개발합니다.

핵심 아키텍처

SpeechT5는 모든 작업에 표준 Transformer 인코더-디코더 백본을 활용합니다. 다양한 데이터 유형을 처리하기 위해 모델은 모듈식 "pre-nets"와 "post-nets"를 사용합니다:

  • Pre-nets: 입력 텍스트 또는 음성을 Transformer 인코더가 필요로 하는 은닉 표현으로 변환합니다.
  • Post-nets: Transformer의 출력 은닉 표현을 텍스트 또는 음성으로 다시 변환합니다.

모델은 모든 pre-nets와 post-nets를 동시에 사용하여 사전 학습되지만, 특정 작업에 대해 미세 조정됩니다. 미세 조정이 완료되면 모델은 해당 작업에 관련된 pre-nets와 post-nets만 사용합니다. 미세 조정 과정에서 가중치가 변경되기 때문에, 하나의 작업(e.g., ASR)으로 미세 조정된 모델은 pre-와 post-nets를 교체하는 것만으로 다른 작업(e.g., TTS)으로 변환될 수 없습니다.

텍스트-음성 (TTS) 기능

SpeechT5는 스피커 임베딩을 사용하여 여러 화자를 위한 오디오를 합성할 수 있는 다목적 텍스트-음성 시스템으로 작동합니다.

기술 구현

For the TTS task, SpeechT5 uses a specific set of modules:

  • Text encoder pre-net: 토큰을 은닉 표현으로 매핑하는 텍스트 임베딩 레이어.
  • Speech decoder pre-net: 로그 멜 스펙트로그램을 은닉 표현으로 압축하는 일련의 선형 레이어(Tacotron 2 기반).
  • Speech decoder post-net: 출력 스펙트로그램을 정제하기 위해 잔차를 예측하는 모듈(Tacotron 2 기반).

오디오 생성 워크플로우

최종 파형을 생성하기 위해 모델은 로그 멜 스펙트로그램을 생성하고, 이는 이후 보코더에 의해 처리되어야 합니다. Hugging Face는 이를 위해 HiFi-GAN 기반 보코더(SpeechT5HifiGan)를 제공합니다. 시스템은 16 kHz의 고정 샘플 레이트로 동작합니다.

음성-음성 및 음성 변환

SpeechT5는 텍스트 인코더 pre-net을 음성 인코더 pre-net으로 교체함으로써 음성-음성 작업, 예를 들어 음성 변환을 수행할 수 있습니다.

기술 구현

  • Speech encoder pre-net: 이 모듈은 컨볼루션 레이어를 사용하여 입력 파형을 오디오 프레임 표현으로 다운샘플링하며, wav2vec 2.0에서 찾을 수 있는 동일한 특징 인코딩 모듈을 활용합니다.

음성 변환은 모델에 입력 음성 파형과 목표 스피커 임베딩을 제공함으로써 이루어지며, 모델은 원본 음성을 목표 스피커의 특성으로 변환합니다.

자동 음성 인식 (ASR)

SpeechT5는 전사 및 스피커 식별을 위한 음성-텍스트 기능을 제공합니다.

기술 구현

For ASR, the model employs:

  • Speech encoder pre-net: 음성-음성 모델에서 사용된 동일한 CNN 특징 인코더(wav2vec 2.0).
  • Text decoder pre-net: 텍스트 토큰을 은닉 표현으로 매핑하는 임베딩 레이어.
  • Text decoder post-net: 은닉 표현을 어휘에 대한 확률로 투사하는 단일 선형 레이어.

토크나이저가 문자 수준에서 작동하기 때문에, 결과 ASR 전사에는 구두점이나 대문자가 포함되지 않습니다.

다양성 요약

통합된 ASR, TTS 및 음성 변환 체크포인트 외에도, 원본 연구는 SpeechT5 아키텍처가 음성 번역, 음성 향상 및 스피커 식별을 수행할 수 있음을 보여줍니다.

Sources