Qwen2.5-Coder 版本說明
Qwen 已宣布發布 Qwen2.5-Coder,這是一系列下一代開源程式碼模型,旨在作為靈活的程式碼合作夥伴。該系列提供 1.5B 與 7B 兩種規模,未來將推出 32B 版本。
技術基礎與訓練
Qwen2.5-Coder 基於 Qwen2.5 基礎模型,並在 5.5 兆 token 的龐大資料集上進行訓練。此訓練語料包含原始程式碼、合成資料以及文字‑程式碼對齊資料,以增強專業的程式碼能力。為確保模型在實際應用(如程式碼代理)中保持多樣性,訓練亦加入了聚焦於數學與一般能力的額外資料。
基礎模型能力
Qwen2.5-Coder 基礎模型支援最高 128K token 的上下文視窗,涵蓋 92 種程式語言。這些模型在多個核心領域展現顯著提升:
- 程式碼任務: 模型在程式碼生成、多程式語言程式碼生成、程式碼補全與程式碼修復方面表現卓越。
- 競爭性能: 7B 版 Qwen2.5-Coder 在多項程式碼相關評估任務中超越更大型的模型,特別是 DeepSeek-Coder-V2-Lite 與 CodeStral-22B。
- 一般熟練度: 模型保留了 Qwen2.5 的一般能力表現,於 MMLU 與 ARC 評測中證實,同時在 GSM8K 與 Math 等數學基準測試中保持競爭力。
Qwen2.5-Coder-Instruct 增強功能
Qwen2.5-Coder-Instruct 為基礎模型的指令微調版本,提供更佳的任務表現與跨基準的泛化能力。
多程式語言與推理
使用 McEval 覆蓋超過 40 種程式語言,Qwen2.5-Coder-Instruct 已證明在流行與小眾語言上皆為專家。此外,透過 CRUXEval 的評測顯示模型在程式碼推理方面表現優異。開發者指出,程式碼推理的提升與更佳的複雜指令遵循能力之間存在相關性。
數學與一般智慧
Qwen2.5-Coder-Instruct 展現出作為「科學學生」的強大表現,彌合了數學基礎與程式碼工具之間的差距。與 DeepSeek-Coder-V2-Lite-Instruct 的正面比較中,Qwen2.5-Coder-7B-Instruct 在多項基準測試上取得更佳結果:
| 基準測試 | Qwen2.5-Coder-7B-Instruct | DeepSeek-Coder-V2-Lite-Instruct |
|---|---|---|
| Math | 66.8 | 61.0 |
| GaoKao2023en | 60.5 | 56.1 |
| OlympiadBench | 29.8 | 26.4 |
| CollegeMath | 43.5 | 39.8 |
| AIME24 | 10.0 | 6.7 |
一般能力基準測試亦偏好 7B-Instruct 模型,MMLU(68.7 對 60.6)、IFEval(58.6 對 38.6)與 GPQA(35.6 對 27.6)皆取得較高分數。
授權與可用性
Qwen2.5-Coder 以 Apache 2.0 授權釋出,旨在鼓勵廣泛應用於程式碼智慧領域。目前已提供 1.5B 與 7B 兩種模型,未來將推出挑戰專有模型的 32B 版本。