Qwen2.5-Coder 系列发布说明

Qwen 已开源 Qwen2.5-Coder 系列,这是一系列专门针对代码的大型语言模型,旨在提供跨多种模型规模的最先进(SOTA)开源编码能力。旗舰模型 Qwen2.5-Coder-32B-Instruct 的编码性能与 GPT-4o 相当,为开源代码 LLMs 设立了新的基准。

Qwen2.5-Coder-32B-Instruct 的 SOTA 编码能力

Qwen2.5-Coder-32B-Instruct 是该系列的旗舰模型,在几个关键编程维度上展示了与 GPT-4o 相当的竞争性能:

代码生成与修复

Qwen2.5-Coder-32B-Instruct 在开源模型中在 EvalPlus、LiveCodeBench 和 BigCodeBench 基准测试中表现最佳。在代码修复——即修复现有代码中错误的能力——该模型在 Aider 基准测试中得分 73.7,与 GPT-4o 表现相当。

代码推理与多语言支持

该模型在代码推理方面表现出色,代码推理涉及通过学习代码执行过程来预测输入和输出。它支持超过 40 种编程语言,在 McEval 基准测试中得分 65.9。这种能力还延伸到多语言代码修复,在 MdEval 基准测试中,该模型在开源模型中排名第一,得分 75.2。

人类偏好对齐

使用内部的 “Code Arena” 基准测试(类似于 Arena Hard)并以 GPT-4o 作为评估模型,Qwen2.5-Coder-32B-Instruct 相较于其他开源模型展示了更优的人类偏好对齐。

多样化的模型规模与伸缩

Qwen2.5-Coder 提供六种不同的规模,以适应各种硬件限制和开发者需求。每种规模均提供 Base 模型(用于微调)和 Instruct 模型(用于直接聊天交互)两种形式。

模型 参数 非嵌入参数 层数 注意力头 (KV) 是否共享嵌入 上下文长度 许可证
Qwen2.5-Coder-0.5B 0.49B 0.36B 24 14 / 2 32K Apache 2.0
Qwen2.5-Coder-1.5B 1.54B 1.31B 28 12 / 2 32K Apache 2.0
Qwen2.5-Coder-3B 3.09B 2.77B 36 16 / 2 32K Qwen Research
Qwen2.5-Coder-7B 7.61B 6.53B 28 28 / 4 128K Apache 2.0
Qwen2.5-Coder-14B 14.7B 13.1B 48 40 / 8 128K Apache 2.0
Qwen2.5-Coder-32B 32.5B 31.0B 64 40 / 8 128K Apache 2.0

在 Base 模型上的 MBPP-3shot 以及 Instruct 模型上的最近四个月 LiveCodeBench 评估表明,模型规模与性能呈正相关,Qwen2.5-Coder 在所有可用规模上实现了 SOTA 性能。

实际应用与集成

Qwen 通过两种主要的集成场景,专注于该系列的实际实用性:

AI 代码助手(Cursor)

Qwen2.5-Coder 被设计为类似 Cursor 的代码助手的强大开源替代方案。32B 模型具体在五个基准测试上展示了 SOTA 代码补全能力(Fill-in-the-Middle 模式):Humaneval-Infilling、CrossCodeEval、CrossCodeLongEval、RepoEval 和 SAFIM。

视觉制品(Open WebUI)

通过与 Open WebUI 集成,Qwen2.5-Coder 可用于创建 “Artifacts”——诸如网站、小游戏和数据图表等视觉作品。Qwen 还计划在通义官方网站上推出专门的代码模式,以支持这些视觉应用的一键生成。

Sources