Qwen1.5-32B 发布说明 / 新功能

Qwen 推出了 Qwen1.5-32B 和 Qwen1.5-32B-Chat,提供一种高性能的替代方案,以降低内存消耗、推理延迟和微调成本。这些模型被定位为用户的最佳平衡点,适用于认为 14B 模型在代理场景等复杂任务上不足,而 72B 模型资源消耗过大的用户。

技术架构与效率

Qwen1.5-32B 保持了 Qwen1.5 系列其余模型的通用架构,唯一的主要区别是加入了分组查询注意力(Grouped Query Attention,GQA)。GQA 的实现使得模型服务更高效,并相较于标准注意力机制提升了推理性能。

性能基准

Qwen1.5-32B 在基础模型、聊天模型和多语言评估中展现出竞争力,常常在 30B 参数范围内超越其他模型。

基础模型能力

在基础能力评估中,Qwen1.5-32B 在大多数任务上优于 Llama2-34B 和 Mixtral-8x7B。虽然其表现略低于 Qwen1.5-72B 模型,但在推理和编码基准上仍具高度竞争力:

模型 MMLU C-Eval GSM8K MATH HumanEval MBPP BBH CMMLU
Qwen1.5-32B 73.4 83.5 77.4 36.1 37.2 49.4 66.8 82.3
Qwen1.5-72B 77.5 84.1 79.5 34.1 41.5 53.4 65.5 83.5
Mixtral-8x7B 70.6 - 74.4 28.4 40.2 60.7 - -
Yi-34B 76.3 81.4 67.2 14.4 23.2 41.0 54.3 83.7
Llama2-34B 62.6 - 42.2 6.2 22.6 33.0 44.1 -

聊天模型评估

Qwen1.5-32B-Chat 采用了包括 RLHF 在内的先进后训练技术,以提升对话能力。它在 MT-Bench 上取得了超过 8 分的成绩,与 72B-Chat 变体相比性能差距相对较小:

模型 MT-Bench(平均分) AlpacaEval 2.0(LC 胜率)
Qwen1.5-32B-Chat 8.30 27.49
Qwen1.5-72B-Chat 8.61 36.60

多语言与长上下文性能

Qwen1.5-32B 支持 12 种语言,包括阿拉伯语、西班牙语、法语、葡萄牙语、德语、意大利语、俄语、日语、韩语、越南语、泰语和印尼语。其在考试、理解、数学和翻译等方面的平均表现为 56.91,高于 Mixtral-8x7B(50.39),略低于 Qwen1.5-72B(60.44)。

此外,该模型在上下文长度最高达 32K token 的“针孔搜索”(Needle in a Haystack)评估中也达到了顶级表现。

Sources