Qwen2.5 LLM 系列发布
TL;DR
Qwen 发布了 Qwen2.5 系列——一系列仅解码器 LLM,参数规模从 0.5B 到 72B,能力最高是之前 Qwen2 模型的两倍,并且 3B、14B、32B 版本全部开源。升级包括更大的 18 万亿 token 预训练语料库,在知识、编码、数学和对齐方面的显著提升,以及最高 128K token 的上下文窗口。
Qwen2.5 发布概览
- 模型阵容 – 七个开源模型(0.5B、1.5B、3B、7B、14B、32B、72B)。3B、14B 和 32B 检查点是新加入的,以满足生产级(10‑30B)和移动端(≈3B)工作负载的需求。
- 授权许可 – 除 Qwen2.5‑3B(Qwen Research License)和 Qwen2.5‑72B(Qwen License)外,所有模型均采用 Apache‑2.0。
- 上下文与生成 – 上下文长度最高 128 K token;生成长度最高 8 K token,支持长篇输出。
- 访问方式 – 除开源检查点外,Qwen‑Plus 和 Qwen‑Turbo 通过阿里云 Model Studio API 提供。
相较于 Qwen2 的技术改进
| 升级项目 | 细节 |
|---|---|
| 数据集规模 | 预训练数据从 7 T token 增加到最高 18 T token。 |
| 知识 | MMLU 分数从 70.3 → 74.2(7B)和 84.2 → 86.1(72B)提升。GPQA、MMLU‑Pro、MMLU‑Redux、ARC‑C 等也有改进。 |
| 编码 | 引入 Qwen2.5‑Coder。Qwen2.5‑72B‑Instruct 在 LiveCodeBench、MultiPL‑E、MBPP 上分别得分 55.5、75.1、88.2,超越 Qwen2‑72B‑Instruct(32.2、69.2、80.2)。 |
| 数学 | 集成 Qwen2‑math 技术。MATH 基准从 52.9 / 69.0 跃升至 75.5(7B)和 83.1(72B)。 |
| 对齐 | Arena‑Hard 分数从 48.1 → 81.2,MT‑Bench 从 9.12 → 9.35(针对 72B 指令模型)。 |
| 其他能力 | 指令遵循、长文本生成(1 K → 8 K token)、表格理解、JSON 生成以及对多样系统提示的鲁棒性均显著提升。 |
模型卡片亮点
| 模型 | 参数 | 层数 | 头数 (KV) | 上下文 | 生成 | 许可证 |
|---|---|---|---|---|---|---|
| Qwen2.5‑0.5B | 0.49 B | 24 | 14/2 | 32 K | 8 K | Apache 2.0 |
| Qwen2.5‑1.5B | 1.54 B | 28 | 12/2 | 32 K | 8 K | Apache 2.0 |
| Qwen2.5‑3B | 3.09 B | 36 | 16/2 | 32 K | 8 K | Qwen Research |
| Qwen2.5‑7B | 7.61 B | 28 | 28/4 | 128 K | 8 K | Apache 2.0 |
| Qwen2.5‑14B | 14.7 B | 48 | 40/8 | 128 K | 8 K | Apache 2.0 |
| Qwen2.5‑32B | 32.5 B | 64 | 40/8 | 128 K | 8 K | Apache 2.0 |
| Qwen2.5‑72B | 72.7 B | 80 | 64/8 | 128 K | 8 K | Qwen |
基准性能 – 基础模型
72B 模型
Qwen2.5‑72B 在各项指标上超越同类,并且在仅使用约 1/5 参数的情况下达到与 Llama‑3‑405B 相当的分数。亮点:
- MMLU:86.1(对比 Qwen2‑72B 为 84.2,Llama‑3‑405B 为 85.2)
- BBH:86.3(对比 Qwen2‑72B 为 82.4)
- GPQA:45.9(对比 37.4)
- MATH:62.1(对比 50.9)
- HumanEval:59.1(对比 Qwen2‑72B 为 64.6,但高于多数开源模型)
- 多语言:在 Multi‑Exam(78.7)和 Multi‑Understanding(89.6)上表现最佳。
中等规模模型
- Qwen2.5‑14B 在 MMLU(79.7)和 BBH(78.2)上击败 Qwen1.5‑32B 及其他 14‑30B 开源模型。
- Qwen2.5‑32B 超越 Qwen2‑57B‑A14B,并在多项任务上达到 Llama‑3‑70B 级别的表现(例如 MMLU 83.3,GSM8K 92.9,MBPP 84.5)。
7B 模型
Qwen2.5‑7B 在参数(非嵌入)相同(6.5 B vs. 6.5 B)的情况下提升了性能。关键分数:MMLU 74.2,MATH 49.8,HumanEval 57.9。
边缘模型(≤3B)
所有三个模型(0.5B、1.5B、3B)相较于 Qwen2 对应模型都有持续提升,尤其在编码(如 3B 的 HumanEval 从 42.1 提升至 74.4)和数学(MATH 从 19.5 提升至 42.6)方面。
指令微调模型
Qwen2.5‑72B‑Instruct
- Arena‑Hard:81.2(对比 Qwen2‑72B‑Instruct 为 48.1)
- MATH:83.1(对比 69.0)
- LiveCodeBench:55.5(对比 32.2)
- MT‑Bench:9.35(对比 9.12)
- 在多项指标上超越 Llama‑3.1‑405B‑Instruct(例如 MMLU‑Pro 71.1 对比 Llama‑3.1‑405B‑Instruct 的 73.3)。
Qwen‑Turbo、Qwen2.5‑14B‑Instruct、Qwen2.5‑32B‑Instruct
- Qwen2.5‑32B‑Instruct 在同尺寸开源模型中取得最高分(例如 MMLU‑Pro 69.0,GSM8K 95.9,HumanEval 88.4)。
- Qwen‑Turbo(API)在多项基准上提供与 GPT‑4o‑mini 相当的竞争力结果,同时保持开源。
7B、3B、1.5B、0.5B 指令模型
所有较小的指令模型相较于基础版本都有大幅相对提升,使其在资源受限的部署中具备可行性。值得注意的例子:
- Qwen2.5‑7B‑Instruct:MATH 75.5,HumanEval 84.8。
- Qwen2.5‑3B‑Instruct:编码(HumanEval 74.4)和数学(MATH 65.9)可与更大的专有模型相媲美。
- Qwen2.5‑1.5B‑Instruct:HumanEval 61.6,MATH 55.2 ——较 Qwen2‑1.5B‑Instruct 提升超过 20 分。
多语言能力
该系列在翻译版 IFEval、特定语言的 MMLU 变体、扩展 MGSM8K 以及文化细微差别基准 BLEnD 上进行评估。72B 指令模型在列出的竞争者中获得最高的多语言分数(例如在多语言 IFEval 上为 86.98,在日语 JMMLU 上为 80.56)。14B 和 7B 指令模型在多语言上也缩小了与更大专有系统的差距。
展示的新功能
- JSON 生成 – 模型能够可靠地输出语法正确的 JSON 结构,对工具调用流水线有用。
- 长篇生成 – 在 8 K token 的生成上限下,Qwen2.5 能够生成论文、报告或代码库而不被截断。
- 结构化数据理解 – 表格解析和多列推理显著提升,如演示套件所示。
对 LLM 生态的影响
- 开源竞争力 – 通过发布超越多数专有模型的 14B 和 32B 检查点,Qwen 缩小了开源与闭源生态的差距。
- 面向生产的中间层 – 10‑30B 区间现已由完全开源模型覆盖,降低了企业自托管 LLM 的准入门槛。
- 边缘部署 – 3B 模型在适合移动或嵌入式设备的体积下提供强大的编码和数学能力。
- 对齐进展 – Arena‑Hard 和 MT‑Bench 的显著提升表明,开源指令微调能够实现与领先闭源模型相当的人类偏好对齐。
模型获取渠道
- GitHub – https://github.com/QwenLM/Qwen2.5
- Hugging Face – https://huggingface.co/Qwen
- ModelScope – https://modelscope.cn/organization/qwen
- Demo – https://huggingface.co/spaces/Qwen/Qwen2.5-72B-Instruct
- API (Qwen‑Turbo, Qwen‑Plus) – 阿里云 Model Studio。
所有数字和表格均原样摘自 Qwen2.5 公告;未添加任何额外声明。