Qwen2.5-Coder 发布说明

Qwen 宣布发布 Qwen2.5-Coder,这是一代面向开源的编码模型系列,旨在作为灵活的编码伙伴。该系列提供 1.5B 和 7B 规模的模型,32B 版本计划在未来发布。

技术基础与训练

Qwen2.5-Coder 基于 Qwen2.5 基础模型构建,并在规模达 5.5 万亿 token 的海量数据集上进行训练。该训练语料包括源代码、合成数据以及文本‑代码对齐数据,以提升专门的编码能力。为确保模型在实际应用(如 Code Agents)中保持多样性,训练还加入了侧重数学和通用能力的额外数据。

基础模型能力

Qwen2.5-Coder 基础模型支持最高 128K token 的上下文窗口,覆盖 92 种编程语言。这些模型在多个核心领域表现出显著提升:

  • 代码任务: 模型在代码生成、多语言代码生成、代码补全和代码修复方面表现出色。
  • 竞争性能: Qwen2.5-Coder 7B 版本在多项代码相关评估任务中超越更大的模型,尤其是 DeepSeek-Coder-V2-Lite 和 CodeStral-22B。
  • 通用能力: 模型保持了 Qwen2.5 的通用能力表现,MMLU 和 ARC 评估证明了这一点,同时在 GSM8K 和 Math 等数学基准上仍具竞争力。

Qwen2.5-Coder-Instruct 增强

Qwen2.5-Coder-Instruct 是基础模型的指令微调版本,提供了更好的任务性能和跨基准的泛化能力。

多语言与推理

使用 McEval 覆盖 40 多种编程语言,Qwen2.5-Coder-Instruct 已被证明在流行语言和小众语言上均是专家。此外,使用 CRUXEval 的评估显示模型在代码推理方面表现出色。开发者指出,代码推理能力的提升与更好地遵循复杂指令之间存在关联。

数学与通用智能

Qwen2.5-Coder-Instruct 作为一名“理科学生”表现出强大的性能,弥合了数学基础与编码工具之间的鸿沟。在与 DeepSeek-Coder-V2-Lite-Instruct 的正面对比中,Qwen2.5-Coder-7B-Instruct 模型在多个基准上取得了更优的结果:

基准 Qwen2.5-Coder-7B-Instruct DeepSeek-Coder-V2-Lite-Instruct
数学 66.8 61.0
GaoKao2023en 60.5 56.1
OlympiadBench 29.8 26.4
CollegeMath 43.5 39.8
AIME24 10.0 6.7

通用能力基准同样倾向于 7B-Instruct 模型,在 MMLU(68.7 对 60.6)、IFEval(58.6 对 38.6)和 GPQA(35.6 对 27.6)上取得更高分数。

许可与可用性

Qwen2.5-Coder 在 Apache 2.0 许可证下发布,以鼓励在代码智能领域的广泛应用。1.5B 和 7B 模型已可获取,32B 版本计划用于挑战专有模型,敬请期待。

Sources