Qwen2-Audio 发布说明
Qwen 已发布 Qwen2-Audio,这是一种接受音频和文本输入并生成文本输出的音频语言模型。该模型实现了直接的语音交互,无需单独的自动语音识别(ASR)模块,并提供了先进的音频分析能力。
关键功能
- 语音聊天: 用户可以直接通过音频提供指令,使模型能够在没有中间 ASR 步骤的情况下响应口头命令。
- 音频分析: 模型可以根据文本指令分析各种音频类型,包括语音、音乐和一般声音。
- 多语言支持: 模型支持超过八种语言和方言,包括英语、中文、粤语、法语、意大利语、西班牙语、德语和日语。
性能与基准测试
Qwen2-Audio 在一系列基准数据集上显著优于原始 Qwen-Audio 以及其他最先进(SOTA)模型。这些基准包括:
- LibriSpeech
- Common Voice 15
- Fleurs
- Aishell2
- CoVoST2
- Meld
- Vocalsound
- AIR-Benchmark
技术架构
该模型基于 Qwen 语言模型和音频编码器构建。训练过程遵循三步序列:
- 多任务预训练: 用于音频-语言对齐。
- 监督微调(SFT): 用于掌握下游任务能力。
- 直接偏好优化(DPO): 用于使模型与人类偏好保持一致。
实现与使用
Qwen2-Audio 官方由 Hugging Face transformers 库支持。用户可以在两种主要模式下使用该模型:
- 语音聊天模式: 输入仅为音频;模型解释音频中包含的指令。
- 音频分析模式: 输入为音频与特定文本指令的配对。
包括 Qwen2-Audio-7B 和 Qwen2-Audio-7B-Instruct 在内的开源权重版本已在 Hugging Face 和 ModelScope 上提供。
未来路线图
Qwen 计划在以下方面扩展 Qwen2-Audio 的能力:
- 数据集扩展: 在更大的预训练数据集上进行训练,以支持超过 30 秒的音频文件。
- 模型扩展: 开发更大规模的模型,以进一步探索音频语言模型的扩展规律。