Qwen2.5-Coder 版本說明

Qwen 已宣布發布 Qwen2.5-Coder,這是一系列下一代開源程式碼模型,旨在作為靈活的程式碼合作夥伴。該系列提供 1.5B 與 7B 兩種規模,未來將推出 32B 版本。

技術基礎與訓練

Qwen2.5-Coder 基於 Qwen2.5 基礎模型,並在 5.5 兆 token 的龐大資料集上進行訓練。此訓練語料包含原始程式碼、合成資料以及文字‑程式碼對齊資料,以增強專業的程式碼能力。為確保模型在實際應用(如程式碼代理)中保持多樣性,訓練亦加入了聚焦於數學與一般能力的額外資料。

基礎模型能力

Qwen2.5-Coder 基礎模型支援最高 128K token 的上下文視窗,涵蓋 92 種程式語言。這些模型在多個核心領域展現顯著提升:

  • 程式碼任務: 模型在程式碼生成、多程式語言程式碼生成、程式碼補全與程式碼修復方面表現卓越。
  • 競爭性能: 7B 版 Qwen2.5-Coder 在多項程式碼相關評估任務中超越更大型的模型,特別是 DeepSeek-Coder-V2-Lite 與 CodeStral-22B。
  • 一般熟練度: 模型保留了 Qwen2.5 的一般能力表現,於 MMLU 與 ARC 評測中證實,同時在 GSM8K 與 Math 等數學基準測試中保持競爭力。

Qwen2.5-Coder-Instruct 增強功能

Qwen2.5-Coder-Instruct 為基礎模型的指令微調版本,提供更佳的任務表現與跨基準的泛化能力。

多程式語言與推理

使用 McEval 覆蓋超過 40 種程式語言,Qwen2.5-Coder-Instruct 已證明在流行與小眾語言上皆為專家。此外,透過 CRUXEval 的評測顯示模型在程式碼推理方面表現優異。開發者指出,程式碼推理的提升與更佳的複雜指令遵循能力之間存在相關性。

數學與一般智慧

Qwen2.5-Coder-Instruct 展現出作為「科學學生」的強大表現,彌合了數學基礎與程式碼工具之間的差距。與 DeepSeek-Coder-V2-Lite-Instruct 的正面比較中,Qwen2.5-Coder-7B-Instruct 在多項基準測試上取得更佳結果:

基準測試 Qwen2.5-Coder-7B-Instruct DeepSeek-Coder-V2-Lite-Instruct
Math 66.8 61.0
GaoKao2023en 60.5 56.1
OlympiadBench 29.8 26.4
CollegeMath 43.5 39.8
AIME24 10.0 6.7

一般能力基準測試亦偏好 7B-Instruct 模型,MMLU(68.7 對 60.6)、IFEval(58.6 對 38.6)與 GPQA(35.6 對 27.6)皆取得較高分數。

授權與可用性

Qwen2.5-Coder 以 Apache 2.0 授權釋出,旨在鼓勵廣泛應用於程式碼智慧領域。目前已提供 1.5B 與 7B 兩種模型,未來將推出挑戰專有模型的 32B 版本。

Sources