Qwen2.5-Coder 系列发布说明
Qwen 已开源 Qwen2.5-Coder 系列,这是一系列专门针对代码的大型语言模型,旨在提供跨多种模型规模的最先进(SOTA)开源编码能力。旗舰模型 Qwen2.5-Coder-32B-Instruct 的编码性能与 GPT-4o 相当,为开源代码 LLMs 设立了新的基准。
Qwen2.5-Coder-32B-Instruct 的 SOTA 编码能力
Qwen2.5-Coder-32B-Instruct 是该系列的旗舰模型,在几个关键编程维度上展示了与 GPT-4o 相当的竞争性能:
代码生成与修复
Qwen2.5-Coder-32B-Instruct 在开源模型中在 EvalPlus、LiveCodeBench 和 BigCodeBench 基准测试中表现最佳。在代码修复——即修复现有代码中错误的能力——该模型在 Aider 基准测试中得分 73.7,与 GPT-4o 表现相当。
代码推理与多语言支持
该模型在代码推理方面表现出色,代码推理涉及通过学习代码执行过程来预测输入和输出。它支持超过 40 种编程语言,在 McEval 基准测试中得分 65.9。这种能力还延伸到多语言代码修复,在 MdEval 基准测试中,该模型在开源模型中排名第一,得分 75.2。
人类偏好对齐
使用内部的 “Code Arena” 基准测试(类似于 Arena Hard)并以 GPT-4o 作为评估模型,Qwen2.5-Coder-32B-Instruct 相较于其他开源模型展示了更优的人类偏好对齐。
多样化的模型规模与伸缩
Qwen2.5-Coder 提供六种不同的规模,以适应各种硬件限制和开发者需求。每种规模均提供 Base 模型(用于微调)和 Instruct 模型(用于直接聊天交互)两种形式。
| 模型 | 参数 | 非嵌入参数 | 层数 | 注意力头 (KV) | 是否共享嵌入 | 上下文长度 | 许可证 |
|---|---|---|---|---|---|---|---|
| Qwen2.5-Coder-0.5B | 0.49B | 0.36B | 24 | 14 / 2 | 是 | 32K | Apache 2.0 |
| Qwen2.5-Coder-1.5B | 1.54B | 1.31B | 28 | 12 / 2 | 是 | 32K | Apache 2.0 |
| Qwen2.5-Coder-3B | 3.09B | 2.77B | 36 | 16 / 2 | 是 | 32K | Qwen Research |
| Qwen2.5-Coder-7B | 7.61B | 6.53B | 28 | 28 / 4 | 否 | 128K | Apache 2.0 |
| Qwen2.5-Coder-14B | 14.7B | 13.1B | 48 | 40 / 8 | 否 | 128K | Apache 2.0 |
| Qwen2.5-Coder-32B | 32.5B | 31.0B | 64 | 40 / 8 | 否 | 128K | Apache 2.0 |
在 Base 模型上的 MBPP-3shot 以及 Instruct 模型上的最近四个月 LiveCodeBench 评估表明,模型规模与性能呈正相关,Qwen2.5-Coder 在所有可用规模上实现了 SOTA 性能。
实际应用与集成
Qwen 通过两种主要的集成场景,专注于该系列的实际实用性:
AI 代码助手(Cursor)
Qwen2.5-Coder 被设计为类似 Cursor 的代码助手的强大开源替代方案。32B 模型具体在五个基准测试上展示了 SOTA 代码补全能力(Fill-in-the-Middle 模式):Humaneval-Infilling、CrossCodeEval、CrossCodeLongEval、RepoEval 和 SAFIM。
视觉制品(Open WebUI)
通过与 Open WebUI 集成,Qwen2.5-Coder 可用于创建 “Artifacts”——诸如网站、小游戏和数据图表等视觉作品。Qwen 还计划在通义官方网站上推出专门的代码模式,以支持这些视觉应用的一键生成。