Qwen2-Audio 릴리즈 노트

Qwen은 오디오와 텍스트 입력을 받아 텍스트 출력을 생성하는 오디오-언어 모델인 Qwen2-Audio를 출시했습니다. 이 모델은 별도의 자동 음성 인식(ASR) 모듈 없이 직접 음성 상호작용을 가능하게 하며 고급 오디오 분석 기능을 제공합니다.

주요 기능

  • Voice Chat: 사용자는 오디오를 통해 직접 지시를 제공할 수 있으며, 모델은 중간 ASR 단계 없이 음성 명령에 응답합니다.
  • Audio Analysis: 모델은 텍스트 지시에 따라 음성, 음악, 일반 소리 등 다양한 오디오 유형을 분석할 수 있습니다.
  • Multilingual Support: 모델은 영어, 중국어, 광동어, 프랑스어, 이탈리아어, 스페인어, 독일어, 일본어 등 8개 이상의 언어와 방언을 지원합니다.

성능 및 벤치마크

Qwen2-Audio는 원래 Qwen-Audio와 다른 최신(state-of-the-art, SOTA) 모델들을 여러 벤치마크 데이터셋에서 크게 능가합니다. 포함된 벤치마크는 다음과 같습니다:

  • LibriSpeech
  • Common Voice 15
  • Fleurs
  • Aishell2
  • CoVoST2
  • Meld
  • Vocalsound
  • AIR-Benchmark

기술 아키텍처

이 모델은 Qwen 언어 모델과 오디오 인코더로 구성된 기반을 사용하여 구축되었습니다. 학습 과정은 세 단계 순서로 진행됩니다:

  1. Multi-task Pretraining: 오디오-언어 정렬에 사용됩니다.
  2. Supervised Finetuning (SFT): 하위 작업 능력을 파악하는 데 사용됩니다.
  3. Direct Preference Optimization (DPO): 모델을 인간 선호도에 맞추는 데 사용됩니다.

구현 및 사용

Qwen2-Audio는 Hugging Face transformers 라이브러리에서 공식적으로 지원됩니다. 사용자는 두 가지 주요 모드로 모델을 구현할 수 있습니다:

  • Voice Chat Mode: 입력이 오디오만으로 구성되며, 모델은 오디오에 포함된 지시를 해석합니다.
  • Audio Analysis Mode: 입력이 오디오와 특정 텍스트 지시가 짝을 이룹니다.

Qwen2-Audio-7BQwen2-Audio-7B-Instruct와 같은 오픈-웨이트 버전은 Hugging Face와 ModelScope에서 제공됩니다.

향후 로드맵

Qwen은 다음 분야에서 Qwen2-Audio의 기능을 확장할 계획입니다:

  • Dataset Expansion: 30초보다 긴 오디오 파일을 지원하기 위해 더 큰 사전 학습 데이터셋으로 훈련합니다.
  • Model Scaling: 오디오 언어 모델의 스케일링 법칙을 더 탐구하기 위해 모델의 더 큰 버전을 개발합니다.

Sources