Qwen2 发布说明 / 新功能

Qwen 已发布 Qwen2,这是 Qwen1.5 系列的进化版,提供五种模型规模(0.5B、1.5B、7B、57B‑A14B 和 72B),旨在提升编码、数学和多语言理解的性能。此次发布的特点是所有规模均采用 Group Query Attention(GQA)以优化推理速度和内存使用,并将训练数据扩展至除英语和中文之外的 27 种额外语言。

模型架构与规格

Qwen2 引入了一系列基础模型和指令微调模型,拥有不同的参数量和上下文窗口能力。关键的架构更新是对所有模型规模统一实现 Group Query Attention(GQA),从而降低内存开销并提升推理速度。

模型 参数 非嵌入参数 GQA 嵌入共享 上下文长度
Qwen2-0.5B 0.49B 0.35B True True 32K
Qwen2-1.5B 1.54B 1.31B True True 32K
Qwen2-7B 7.07B 5.98B True False 128K
Qwen2-57B-A14B 57.41B 56.32B True False 64K
Qwen2-72B 72.71B 70.21B True False 128K

对于较小的模型(0.5B 和 1.5B),Qwen 使用共享嵌入以防止大规模稀疏嵌入占据大部分参数量。

多语言扩展与代码切换

Qwen2 已在额外的 27 种语言上进行训练,以提升其全球适用性。此扩展覆盖了多个关键地区:

  • 西欧: 德语、法语、西班牙语、葡萄牙语、意大利语、荷兰语
  • 东欧与中欧: 俄语、捷克语、波兰语
  • 中东: 阿拉伯语、波斯语、希伯来语、土耳其语
  • 东亚: 日语、韩语
  • 东南亚: 越南语、泰语、印尼语、马来语、老挝语、缅甸语、宿务语、高棉语、他加禄语
  • 南亚: 印地语、孟加拉语、乌尔都语

除了增加语言之外,团队还专注于提升模型处理“代码切换”(在单个提示中混合多种语言)的能力,使多语言评估中的相关错误显著减少。

性能基准

大规模模型性能 (Qwen2-72B)

Qwen2-72B 在参数更少的情况下,表现出比前代 Qwen1.5-110B 更优的性能。在基础模型评估中,Qwen2-72B 在多个指标上超越 Llama-3-70B,包括 MMLU(84.2 对 79.5)和 HumanEval(64.6 对 48.2)。

指令微调模型能力

Qwen2-72B-Instruct 相较于 Qwen1.5-72B-Chat 有显著提升,并且在竞争中仍能与 Llama-3-70B-Instruct 相匹配。关键亮点包括:

  • 编码与数学: 融入 CodeQwen1.5 数据后,编程能力得到提升。Qwen2-72B-Instruct 在 MATH 上取得 59.7 分,超过 Llama-3-70B-Instruct 的 50.4 分。
  • 推理: 模型在 Arena-Hard(48.1)和 MT-Bench(9.12)上表现强劲。

小型和中型模型

Qwen2-7B-Instruct 在同等规模的 SOTA 模型中表现领先,尤其在编码和中文相关指标上。Qwen2-0.5B 与 1.5B 也相较于前代有所提升,Qwen2-1.5B-Instruct 在 MMLU 上达到 52.4 分。

长上下文理解

所有指令微调模型均在 32K token 的上下文上进行预训练。通过使用 YARN 和 Dual Chunk Attention,模型已被外推以处理更长的序列:

  • Qwen2-72B-Instruct 和 Qwen2-7B-Instruct: 支持最高 128K token,在“干草堆中的针”测试中几乎完美地提取信息。
  • Qwen2-57B-A14B-Instruct: 支持最高 64K token。
  • 小模型 (0.5B/1.5B): 支持最高 32K token。

安全性与多语言责任

Qwen2-72B-Instruct 旨在做到有帮助、诚实且无害。在涉及多语言不安全查询(非法活动、欺诈、色情、隐私暴力)的安全评估中,Qwen2-72B-Instruct 的表现与 GPT-4 相当,且显著优于 Mistral-8x22B。例如,在“非法活动”类别中,Qwen2-72B-Instruct 在所有测试语言中保持 0% 有害响应率,匹配 GPT-4。

许可与可用性

Qwen 已更新系列的许可,以鼓励更广泛的商业采用:

  • Apache 2.0: 适用于 Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B 和 Qwen2-57B-A14B。
  • 千问许可证: 保持对 Qwen2-72B 及其指令微调变体的使用。

模型可在 Hugging Face 和 ModelScope 上获取。

Sources