Qwen2.5 LLM 系列發布

TL;DR

Qwen 發布了 Qwen2.5 系列——一個從 0.5B 到 72B 參數的僅解碼器 LLM 家族,其能力是先前 Qwen2 模型的兩倍,同時 3B、14B 與 32B 版本完全開源。升級內容包括更大的 18 兆 token 預訓練語料庫、在知識、程式碼、數學與對齊方面的重大提升,以及最高 128K token 的上下文窗口。

Qwen2.5 發布概覽

  • 模型系列 – 七個開源模型 (0.5B, 1.5B, 3B, 7B, 14B, 32B, 72B)。3B、14B 與 32B 檢查點是新加入,以滿足生產等級 (10‑30B) 與行動端 (≈3B) 工作負載的需求。
  • 授權 – 除 Qwen2.5‑3B(Qwen Research License)與 Qwen2.5‑72B(Qwen License)外,所有模型皆採用 Apache‑2.0。
  • 上下文與生成 – 上下文長度最高 128 K token;生成長度最高 8 K token,支援長篇輸出。
  • 存取 – 除了開源檢查點外,Qwen‑Plus 與 Qwen‑Turbo 亦透過阿里雲 Model Studio API 提供。

相較於 Qwen2 的技術升級

升級項目 詳細說明
資料集規模 預訓練資料從 7 T token 增加至最高 18 T token
知識 MMLU 分數從 70.3 提升至 74.2(7B),以及 84.2 提升至 86.1(72B)。在 GPQA、MMLU‑Pro、MMLU‑Redux、ARC‑C 亦有提升。
程式碼 引入 Qwen2.5‑Coder。Qwen2.5‑72B‑Instruct 在 LiveCodeBench、MultiPL‑E、MBPP 的分別為 55.5、75.1、88.2,超過 Qwen2‑72B‑Instruct(32.2、69.2、80.2)。
數學 整合 Qwen2‑math 技術。MATH 基準分數從 52.9 / 69.0 提升至 75.5(7B)與 83.1(72B)。
對齊 Arena‑Hard 分數從 48.1 提升至 81.2,MT‑Bench 從 9.12 提升至 9.35(72B 指令模型)。
其他能力 指令遵循、長文本生成(1 K → 8 K token)、表格理解、JSON 生成,以及對多樣系統提示的魯棒性皆顯著提升。

模型卡亮點

模型 參數 層數 Heads (KV) 上下文 生成 授權
Qwen2.5‑0.5B 0.49 B 24 14/2 32 K 8 K Apache 2.0
Qwen2.5‑1.5B 1.54 B 28 12/2 32 K 8 K Apache 2.0
Qwen2.5‑3B 3.09 B 36 16/2 32 K 8 K Qwen Research
Qwen2.5‑7B 7.61 B 28 28/4 128 K 8 K Apache 2.0
Qwen2.5‑14B 14.7 B 48 40/8 128 K 8 K Apache 2.0
Qwen2.5‑32B 32.5 B 64 40/8 128 K 8 K Apache 2.0
Qwen2.5‑72B 72.7 B 80 64/8 128 K 8 K Qwen

基準效能 – 基礎模型

72B 模型

Qwen2.5‑72B 在各項指標上均優於同儕,且以約 1/5 的參數量達到與 Llama‑3‑405B 相當的分數。重點如下:

  • MMLU:86.1(相較 Qwen2‑72B 為 84.2,Llama‑3‑405B 為 85.2)
  • BBH:86.3(相較 Qwen2‑72B 為 82.4)
  • GPQA:45.9(相較 37.4)
  • MATH:62.1(相較 50.9)
  • HumanEval:59.1(相較 Qwen2‑72B 為 64.6,但高於多數開源模型)
  • 多語言:在 Multi‑Exam(78.7)與 Multi‑Understanding(89.6)上表現最佳。

中型模型

  • Qwen2.5‑14B 在 MMLU(79.7)與 BBH(78.2)上超過 Qwen1.5‑32B 及其他 14‑30B 開源模型。
  • Qwen2.5‑32B 超越 Qwen2‑57B‑A14B,並在多項任務上達到 Llama‑3‑70B 水平(例如 MMLU 83.3、GSM8K 92.9、MBPP 84.5)。

7B 模型

Qwen2.5‑7B 在非嵌入參數較少(6.5 B vs. 6.5 B)的情況下仍優於 Qwen2‑7B。主要分數:MMLU 74.2、MATH 49.8、HumanEval 57.9。

邊緣模型(≤3B)

所有三個模型(0.5B、1.5B、3B)相較 Qwen2 版本皆有一致提升,特別在程式碼(例如 HumanEval 42.1 → 74.4,3B)與數學(MATH 19.5 → 42.6,3B)上。

指令微調模型

Qwen2.5‑72B‑Instruct

  • Arena‑Hard:81.2(相較 Qwen2‑72B‑Instruct 為 48.1)
  • MATH:83.1(相較 69.0)
  • LiveCodeBench:55.5(相較 32.2)
  • MT‑Bench:9.35(相較 9.12)
  • 在多項指標上優於 Llama‑3.1‑405B‑Instruct(例如 MMLU‑Pro 71.1 vs. Llama‑3.1‑405B‑Instruct 的 73.3)。

Qwen‑Turbo、Qwen2.5‑14B‑Instruct、Qwen2.5‑32B‑Instruct

  • Qwen2.5‑32B‑Instruct 在相似規模的開源模型中取得最高分(例如 MMLU‑Pro 69.0、GSM8K 95.9、HumanEval 88.4)。
  • Qwen‑Turbo(API)在多項基準測試中提供與 GPT‑4o‑mini 相當的競爭力,同時保持開源。

7B、3B、1.5B、0.5B 指令模型

所有較小的指令模型相較基礎版本皆有顯著提升,使其適用於資源受限的部署。值得注意的例子:

  • Qwen2.5‑7B‑Instruct:MATH 75.5、HumanEval 84.8。
  • Qwen2.5‑3B‑Instruct:程式碼(HumanEval 74.4)與數學(MATH 65.9)可與較大型專有模型相媲美。
  • Qwen2.5‑1.5B‑Instruct:HumanEval 61.6、MATH 55.2——較 Qwen2‑1.5B‑Instruct 提升超過 20 點。

多語言能力

此系列在翻譯版 IFEval、語言特定 MMLU 變體、擴充版 MGSM8K 與文化細微差異基準 BLEnD 上進行評測。72B 指令模型在列出的競爭者中取得最高的多語言分數(例如 86.98 在多語言 IFEval,80.56 在日文 JMMLU)。14B 與 7B 指令模型亦在多語言上縮小與較大型專有系統的差距。

新功能示範

  • JSON 生成 – 模型能可靠產生語法正確的 JSON 結構,適用於工具呼叫流程。
  • 長篇生成 – 以 8 K token 的生成上限,Qwen2.5 可產出不被截斷的文章、報告或程式碼庫。
  • 結構化資料理解 – 表格解析與多欄位推理顯著提升,如示範套件所示。

對 LLM 生態的影響

  • 開源競爭力 – 釋出超越多數專有模型的 14B 與 32B 檢查點,使 Qwen 縮小開放與封閉生態系的差距。
  • 可投入生產的中階層 – 10‑30B 範圍現已由完全開源模型覆蓋,降低企業自建 LLM 的門檻。
  • 邊緣部署 – 3B 模型在適合行動或嵌入式裝置的體積下,提供強大的程式碼與數學能力。
  • 對齊進展 – 在 Arena‑Hard 與 MT‑Bench 上的顯著提升顯示開源指令微調可達到與領先封閉模型相當的人類偏好對齊。

模型取得方式


所有數字與表格均直接取自 Qwen2.5 公告,未加入其他主張。


SUMMARY: Qwen 宣佈了 Qwen2.5 系列——開源的僅解碼器 LLM,參數從 0.5B 到 72B,能力是 Qwen2 的兩倍,並加入了更大的 18 兆 token 資料集,在知識、程式碼、數學與對齊方面取得重大提升,且支援 128K token 的上下文窗口。

TITLE: Qwen2.5 LLM 系列發布

Sources