Qwen2-Audio 發布說明

Qwen 已發布 Qwen2-Audio,一款接受音訊與文字輸入並產生文字輸出的音頻語言模型。此模型可直接進行語音互動,無需額外的自動語音辨識 (ASR) 模組,並提供先進的音頻分析功能。

主要功能

Qwen2-Audio 提供三項主要功能:

  • 語音聊天: 使用者可直接以音訊提供指令,使模型能在無需中間 ASR 步驟的情況下回應語音指令。
  • 音頻分析: 模型可根據文字指示分析各種音訊類型,包括語音、音樂與一般聲音。
  • 多語言支援: 模型支援超過八種語言與方言,包括英語、中文、粵語、法語、義大利語、西班牙語、德語與日語。

效能與基準測試

Qwen2-Audio 在多項基準資料集上顯著優於原始 Qwen-Audio 以及其他最先進 (SOTA) 模型。這些基準測試包括:

  • LibriSpeech
  • Common Voice 15
  • Fleurs
  • Aishell2
  • CoVoST2
  • Meld
  • Vocalsound
  • AIR-Benchmark

技術架構

該模型以 Qwen 語言模型與音訊編碼器為基礎構建。訓練過程遵循三步驟序列:

  1. 多任務預訓練: 用於音頻與語言的對齊。
  2. 監督式微調 (SFT): 用於掌握下游任務能力。
  3. 直接偏好優化 (DPO): 用於使模型與人類偏好對齊。

實作與使用

Qwen2-Audio 正式由 Hugging Face transformers 函式庫支援。使用者可在兩種主要模式下使用模型:

  • 語音聊天模式: 輸入僅為音訊;模型會解讀音訊中包含的指令。
  • 音頻分析模式: 輸入為音訊與特定文字指示的組合。

開放權重版本,包括 Qwen2-Audio-7BQwen2-Audio-7B-Instruct,已在 Hugging Face 與 ModelScope 上提供。

未來路線圖

Qwen 計畫在以下領域擴展 Qwen2-Audio 的功能:

  • 資料集擴充: 使用更大的預訓練資料集進行訓練,以支援超過 30 秒的音訊檔案。
  • 模型擴展: 開發更大型號的模型,以進一步探索音頻語言模型的擴展規律。

Sources