Qwen1.5-32B 发布说明 / 新功能
Qwen 推出了 Qwen1.5-32B 和 Qwen1.5-32B-Chat,提供一种高性能的替代方案,以降低内存消耗、推理延迟和微调成本。这些模型被定位为用户的最佳平衡点,适用于认为 14B 模型在代理场景等复杂任务上不足,而 72B 模型资源消耗过大的用户。
技术架构与效率
Qwen1.5-32B 保持了 Qwen1.5 系列其余模型的通用架构,唯一的主要区别是加入了分组查询注意力(Grouped Query Attention,GQA)。GQA 的实现使得模型服务更高效,并相较于标准注意力机制提升了推理性能。
性能基准
Qwen1.5-32B 在基础模型、聊天模型和多语言评估中展现出竞争力,常常在 30B 参数范围内超越其他模型。
基础模型能力
在基础能力评估中,Qwen1.5-32B 在大多数任务上优于 Llama2-34B 和 Mixtral-8x7B。虽然其表现略低于 Qwen1.5-72B 模型,但在推理和编码基准上仍具高度竞争力:
| 模型 | MMLU | C-Eval | GSM8K | MATH | HumanEval | MBPP | BBH | CMMLU |
|---|---|---|---|---|---|---|---|---|
| Qwen1.5-32B | 73.4 | 83.5 | 77.4 | 36.1 | 37.2 | 49.4 | 66.8 | 82.3 |
| Qwen1.5-72B | 77.5 | 84.1 | 79.5 | 34.1 | 41.5 | 53.4 | 65.5 | 83.5 |
| Mixtral-8x7B | 70.6 | - | 74.4 | 28.4 | 40.2 | 60.7 | - | - |
| Yi-34B | 76.3 | 81.4 | 67.2 | 14.4 | 23.2 | 41.0 | 54.3 | 83.7 |
| Llama2-34B | 62.6 | - | 42.2 | 6.2 | 22.6 | 33.0 | 44.1 | - |
聊天模型评估
Qwen1.5-32B-Chat 采用了包括 RLHF 在内的先进后训练技术,以提升对话能力。它在 MT-Bench 上取得了超过 8 分的成绩,与 72B-Chat 变体相比性能差距相对较小:
| 模型 | MT-Bench(平均分) | AlpacaEval 2.0(LC 胜率) |
|---|---|---|
| Qwen1.5-32B-Chat | 8.30 | 27.49 |
| Qwen1.5-72B-Chat | 8.61 | 36.60 |
多语言与长上下文性能
Qwen1.5-32B 支持 12 种语言,包括阿拉伯语、西班牙语、法语、葡萄牙语、德语、意大利语、俄语、日语、韩语、越南语、泰语和印尼语。其在考试、理解、数学和翻译等方面的平均表现为 56.91,高于 Mixtral-8x7B(50.39),略低于 Qwen1.5-72B(60.44)。
此外,该模型在上下文长度最高达 32K token 的“针孔搜索”(Needle in a Haystack)评估中也达到了顶级表现。