Qwen2.5 LLM 系列发布

TL;DR

Qwen 发布了 Qwen2.5 系列——一系列仅解码器 LLM,参数规模从 0.5B 到 72B,能力最高是之前 Qwen2 模型的两倍,并且 3B、14B、32B 版本全部开源。升级包括更大的 18 万亿 token 预训练语料库,在知识、编码、数学和对齐方面的显著提升,以及最高 128K token 的上下文窗口。

Qwen2.5 发布概览

  • 模型阵容 – 七个开源模型(0.5B、1.5B、3B、7B、14B、32B、72B)。3B、14B 和 32B 检查点是新加入的,以满足生产级(10‑30B)和移动端(≈3B)工作负载的需求。
  • 授权许可 – 除 Qwen2.5‑3B(Qwen Research License)和 Qwen2.5‑72B(Qwen License)外,所有模型均采用 Apache‑2.0。
  • 上下文与生成 – 上下文长度最高 128 K token;生成长度最高 8 K token,支持长篇输出。
  • 访问方式 – 除开源检查点外,Qwen‑Plus 和 Qwen‑Turbo 通过阿里云 Model Studio API 提供。

相较于 Qwen2 的技术改进

升级项目 细节
数据集规模 预训练数据从 7 T token 增加到最高 18 T token
知识 MMLU 分数从 70.3 → 74.2(7B)和 84.2 → 86.1(72B)提升。GPQA、MMLU‑Pro、MMLU‑Redux、ARC‑C 等也有改进。
编码 引入 Qwen2.5‑Coder。Qwen2.5‑72B‑Instruct 在 LiveCodeBench、MultiPL‑E、MBPP 上分别得分 55.5、75.1、88.2,超越 Qwen2‑72B‑Instruct(32.2、69.2、80.2)。
数学 集成 Qwen2‑math 技术。MATH 基准从 52.9 / 69.0 跃升至 75.5(7B)和 83.1(72B)。
对齐 Arena‑Hard 分数从 48.1 → 81.2,MT‑Bench 从 9.12 → 9.35(针对 72B 指令模型)。
其他能力 指令遵循、长文本生成(1 K → 8 K token)、表格理解、JSON 生成以及对多样系统提示的鲁棒性均显著提升。

模型卡片亮点

模型 参数 层数 头数 (KV) 上下文 生成 许可证
Qwen2.5‑0.5B 0.49 B 24 14/2 32 K 8 K Apache 2.0
Qwen2.5‑1.5B 1.54 B 28 12/2 32 K 8 K Apache 2.0
Qwen2.5‑3B 3.09 B 36 16/2 32 K 8 K Qwen Research
Qwen2.5‑7B 7.61 B 28 28/4 128 K 8 K Apache 2.0
Qwen2.5‑14B 14.7 B 48 40/8 128 K 8 K Apache 2.0
Qwen2.5‑32B 32.5 B 64 40/8 128 K 8 K Apache 2.0
Qwen2.5‑72B 72.7 B 80 64/8 128 K 8 K Qwen

基准性能 – 基础模型

72B 模型

Qwen2.5‑72B 在各项指标上超越同类,并且在仅使用约 1/5 参数的情况下达到与 Llama‑3‑405B 相当的分数。亮点:

  • MMLU:86.1(对比 Qwen2‑72B 为 84.2,Llama‑3‑405B 为 85.2)
  • BBH:86.3(对比 Qwen2‑72B 为 82.4)
  • GPQA:45.9(对比 37.4)
  • MATH:62.1(对比 50.9)
  • HumanEval:59.1(对比 Qwen2‑72B 为 64.6,但高于多数开源模型)
  • 多语言:在 Multi‑Exam(78.7)和 Multi‑Understanding(89.6)上表现最佳。

中等规模模型

  • Qwen2.5‑14B 在 MMLU(79.7)和 BBH(78.2)上击败 Qwen1.5‑32B 及其他 14‑30B 开源模型。
  • Qwen2.5‑32B 超越 Qwen2‑57B‑A14B,并在多项任务上达到 Llama‑3‑70B 级别的表现(例如 MMLU 83.3,GSM8K 92.9,MBPP 84.5)。

7B 模型

Qwen2.5‑7B 在参数(非嵌入)相同(6.5 B vs. 6.5 B)的情况下提升了性能。关键分数:MMLU 74.2,MATH 49.8,HumanEval 57.9。

边缘模型(≤3B)

所有三个模型(0.5B、1.5B、3B)相较于 Qwen2 对应模型都有持续提升,尤其在编码(如 3B 的 HumanEval 从 42.1 提升至 74.4)和数学(MATH 从 19.5 提升至 42.6)方面。

指令微调模型

Qwen2.5‑72B‑Instruct

  • Arena‑Hard:81.2(对比 Qwen2‑72B‑Instruct 为 48.1)
  • MATH:83.1(对比 69.0)
  • LiveCodeBench:55.5(对比 32.2)
  • MT‑Bench:9.35(对比 9.12)
  • 在多项指标上超越 Llama‑3.1‑405B‑Instruct(例如 MMLU‑Pro 71.1 对比 Llama‑3.1‑405B‑Instruct 的 73.3)。

Qwen‑Turbo、Qwen2.5‑14B‑Instruct、Qwen2.5‑32B‑Instruct

  • Qwen2.5‑32B‑Instruct 在同尺寸开源模型中取得最高分(例如 MMLU‑Pro 69.0,GSM8K 95.9,HumanEval 88.4)。
  • Qwen‑Turbo(API)在多项基准上提供与 GPT‑4o‑mini 相当的竞争力结果,同时保持开源。

7B、3B、1.5B、0.5B 指令模型

所有较小的指令模型相较于基础版本都有大幅相对提升,使其在资源受限的部署中具备可行性。值得注意的例子:

  • Qwen2.5‑7B‑Instruct:MATH 75.5,HumanEval 84.8。
  • Qwen2.5‑3B‑Instruct:编码(HumanEval 74.4)和数学(MATH 65.9)可与更大的专有模型相媲美。
  • Qwen2.5‑1.5B‑Instruct:HumanEval 61.6,MATH 55.2 ——较 Qwen2‑1.5B‑Instruct 提升超过 20 分。

多语言能力

该系列在翻译版 IFEval、特定语言的 MMLU 变体、扩展 MGSM8K 以及文化细微差别基准 BLEnD 上进行评估。72B 指令模型在列出的竞争者中获得最高的多语言分数(例如在多语言 IFEval 上为 86.98,在日语 JMMLU 上为 80.56)。14B 和 7B 指令模型在多语言上也缩小了与更大专有系统的差距。

展示的新功能

  • JSON 生成 – 模型能够可靠地输出语法正确的 JSON 结构,对工具调用流水线有用。
  • 长篇生成 – 在 8 K token 的生成上限下,Qwen2.5 能够生成论文、报告或代码库而不被截断。
  • 结构化数据理解 – 表格解析和多列推理显著提升,如演示套件所示。

对 LLM 生态的影响

  • 开源竞争力 – 通过发布超越多数专有模型的 14B 和 32B 检查点,Qwen 缩小了开源与闭源生态的差距。
  • 面向生产的中间层 – 10‑30B 区间现已由完全开源模型覆盖,降低了企业自托管 LLM 的准入门槛。
  • 边缘部署 – 3B 模型在适合移动或嵌入式设备的体积下提供强大的编码和数学能力。
  • 对齐进展 – Arena‑Hard 和 MT‑Bench 的显著提升表明,开源指令微调能够实现与领先闭源模型相当的人类偏好对齐。

模型获取渠道


所有数字和表格均原样摘自 Qwen2.5 公告;未添加任何额外声明。

Sources