Qwen2-Audio 发布说明

Qwen 已发布 Qwen2-Audio,这是一种接受音频和文本输入并生成文本输出的音频语言模型。该模型实现了直接的语音交互,无需单独的自动语音识别(ASR)模块,并提供了先进的音频分析能力。

关键功能

  • 语音聊天: 用户可以直接通过音频提供指令,使模型能够在没有中间 ASR 步骤的情况下响应口头命令。
  • 音频分析: 模型可以根据文本指令分析各种音频类型,包括语音、音乐和一般声音。
  • 多语言支持: 模型支持超过八种语言和方言,包括英语、中文、粤语、法语、意大利语、西班牙语、德语和日语。

性能与基准测试

Qwen2-Audio 在一系列基准数据集上显著优于原始 Qwen-Audio 以及其他最先进(SOTA)模型。这些基准包括:

  • LibriSpeech
  • Common Voice 15
  • Fleurs
  • Aishell2
  • CoVoST2
  • Meld
  • Vocalsound
  • AIR-Benchmark

技术架构

该模型基于 Qwen 语言模型和音频编码器构建。训练过程遵循三步序列:

  1. 多任务预训练: 用于音频-语言对齐。
  2. 监督微调(SFT): 用于掌握下游任务能力。
  3. 直接偏好优化(DPO): 用于使模型与人类偏好保持一致。

实现与使用

Qwen2-Audio 官方由 Hugging Face transformers 库支持。用户可以在两种主要模式下使用该模型:

  • 语音聊天模式: 输入仅为音频;模型解释音频中包含的指令。
  • 音频分析模式: 输入为音频与特定文本指令的配对。

包括 Qwen2-Audio-7BQwen2-Audio-7B-Instruct 在内的开源权重版本已在 Hugging Face 和 ModelScope 上提供。

未来路线图

Qwen 计划在以下方面扩展 Qwen2-Audio 的能力:

  • 数据集扩展: 在更大的预训练数据集上进行训练,以支持超过 30 秒的音频文件。
  • 模型扩展: 开发更大规模的模型,以进一步探索音频语言模型的扩展规律。

Sources