Qwen2.5-Coder 发布说明
Qwen 宣布发布 Qwen2.5-Coder,这是一代面向开源的编码模型系列,旨在作为灵活的编码伙伴。该系列提供 1.5B 和 7B 规模的模型,32B 版本计划在未来发布。
技术基础与训练
Qwen2.5-Coder 基于 Qwen2.5 基础模型构建,并在规模达 5.5 万亿 token 的海量数据集上进行训练。该训练语料包括源代码、合成数据以及文本‑代码对齐数据,以提升专门的编码能力。为确保模型在实际应用(如 Code Agents)中保持多样性,训练还加入了侧重数学和通用能力的额外数据。
基础模型能力
Qwen2.5-Coder 基础模型支持最高 128K token 的上下文窗口,覆盖 92 种编程语言。这些模型在多个核心领域表现出显著提升:
- 代码任务: 模型在代码生成、多语言代码生成、代码补全和代码修复方面表现出色。
- 竞争性能: Qwen2.5-Coder 7B 版本在多项代码相关评估任务中超越更大的模型,尤其是 DeepSeek-Coder-V2-Lite 和 CodeStral-22B。
- 通用能力: 模型保持了 Qwen2.5 的通用能力表现,MMLU 和 ARC 评估证明了这一点,同时在 GSM8K 和 Math 等数学基准上仍具竞争力。
Qwen2.5-Coder-Instruct 增强
Qwen2.5-Coder-Instruct 是基础模型的指令微调版本,提供了更好的任务性能和跨基准的泛化能力。
多语言与推理
使用 McEval 覆盖 40 多种编程语言,Qwen2.5-Coder-Instruct 已被证明在流行语言和小众语言上均是专家。此外,使用 CRUXEval 的评估显示模型在代码推理方面表现出色。开发者指出,代码推理能力的提升与更好地遵循复杂指令之间存在关联。
数学与通用智能
Qwen2.5-Coder-Instruct 作为一名“理科学生”表现出强大的性能,弥合了数学基础与编码工具之间的鸿沟。在与 DeepSeek-Coder-V2-Lite-Instruct 的正面对比中,Qwen2.5-Coder-7B-Instruct 模型在多个基准上取得了更优的结果:
| 基准 | Qwen2.5-Coder-7B-Instruct | DeepSeek-Coder-V2-Lite-Instruct |
|---|---|---|
| 数学 | 66.8 | 61.0 |
| GaoKao2023en | 60.5 | 56.1 |
| OlympiadBench | 29.8 | 26.4 |
| CollegeMath | 43.5 | 39.8 |
| AIME24 | 10.0 | 6.7 |
通用能力基准同样倾向于 7B-Instruct 模型,在 MMLU(68.7 对 60.6)、IFEval(58.6 对 38.6)和 GPQA(35.6 对 27.6)上取得更高分数。
许可与可用性
Qwen2.5-Coder 在 Apache 2.0 许可证下发布,以鼓励在代码智能领域的广泛应用。1.5B 和 7B 模型已可获取,32B 版本计划用于挑战专有模型,敬请期待。