Qwen2-Audio 發布說明
Qwen 已發布 Qwen2-Audio,一款接受音訊與文字輸入並產生文字輸出的音頻語言模型。此模型可直接進行語音互動,無需額外的自動語音辨識 (ASR) 模組,並提供先進的音頻分析功能。
主要功能
Qwen2-Audio 提供三項主要功能:
- 語音聊天: 使用者可直接以音訊提供指令,使模型能在無需中間 ASR 步驟的情況下回應語音指令。
- 音頻分析: 模型可根據文字指示分析各種音訊類型,包括語音、音樂與一般聲音。
- 多語言支援: 模型支援超過八種語言與方言,包括英語、中文、粵語、法語、義大利語、西班牙語、德語與日語。
效能與基準測試
Qwen2-Audio 在多項基準資料集上顯著優於原始 Qwen-Audio 以及其他最先進 (SOTA) 模型。這些基準測試包括:
- LibriSpeech
- Common Voice 15
- Fleurs
- Aishell2
- CoVoST2
- Meld
- Vocalsound
- AIR-Benchmark
技術架構
該模型以 Qwen 語言模型與音訊編碼器為基礎構建。訓練過程遵循三步驟序列:
- 多任務預訓練: 用於音頻與語言的對齊。
- 監督式微調 (SFT): 用於掌握下游任務能力。
- 直接偏好優化 (DPO): 用於使模型與人類偏好對齊。
實作與使用
Qwen2-Audio 正式由 Hugging Face transformers 函式庫支援。使用者可在兩種主要模式下使用模型:
- 語音聊天模式: 輸入僅為音訊;模型會解讀音訊中包含的指令。
- 音頻分析模式: 輸入為音訊與特定文字指示的組合。
開放權重版本,包括 Qwen2-Audio-7B 與 Qwen2-Audio-7B-Instruct,已在 Hugging Face 與 ModelScope 上提供。
未來路線圖
Qwen 計畫在以下領域擴展 Qwen2-Audio 的功能:
- 資料集擴充: 使用更大的預訓練資料集進行訓練,以支援超過 30 秒的音訊檔案。
- 模型擴展: 開發更大型號的模型,以進一步探索音頻語言模型的擴展規律。