Qwen2 版本說明 / 新功能

Qwen 已發布 Qwen2,這是 Qwen1.5 系列的演進,提供五種模型規模(0.5B、1.5B、7B、57B‑A14B 與 72B),旨在提升程式碼、數學與多語言理解的效能。此版本的特點是所有規模均採用 Group Query Attention(GQA)以優化推理速度與記憶體使用,並將訓練資料擴展至除英語與中文外的 27 種額外語言。

模型架構與規格

Qwen2 引入了一系列基礎模型與指令微調模型,具備不同的參數量與上下文窗口能力。關鍵的架構更新是所有模型尺寸皆統一實作 Group Query Attention(GQA),可減少記憶體開銷並提升推理速度。

模型 參數 非嵌入參數 GQA 共享嵌入 上下文長度
Qwen2-0.5B 0.49B 0.35B True True 32K
Qwen2-1.5B 1.54B 1.31B True True 32K
Qwen2-7B 7.07B 5.98B True False 128K
Qwen2-57B-A14B 57.41B 56.32B True False 64K
Qwen2-72B 72.71B 70.21B True False 128K

對於較小的模型(0.5B 和 1.5B),Qwen 使用共享嵌入,以防止大型稀疏嵌入佔據總參數量的主要部分。

多語言擴展與語碼切換

Qwen2 已在額外的 27 種語言上進行訓練,以增強其全球實用性。此擴展涵蓋多個關鍵區域:

  • 西歐:德語、法語、西班牙語、葡萄牙語、義大利語、荷蘭語
  • 東歐與中歐:俄語、捷克語、波蘭語
  • 中東:阿拉伯語、波斯語、希伯來語、土耳其語
  • 東亞:日語、韓語
  • 東南亞:越南語、泰語、印尼語、馬來語、老撾語、緬甸語、宿務語、高棉語、塔加路語
  • 南亞:印地語、孟加拉語、烏爾都語

除了新增語言外,團隊還致力於提升模型處理「語碼切換」(在單一提示中混合多種語言)的能力,從而在多語言評估中大幅降低相關錯誤。

效能基準

大規模模型效能(Qwen2-72B)

Qwen2-72B 展現出相較於前代 Qwen1.5-110B 更優的效能,儘管參數較少。在基礎模型評估中,Qwen2-72B 在多項指標上超過 Llama-3-70B,包括 MMLU(84.2 對 79.5)和 HumanEval(64.6 對 48.2)。

指令微調模型能力

Qwen2-72B-Instruct 相較於 Qwen1.5-72B-Chat 有顯著提升,且在與 Llama-3-70B-Instruct 的競爭中保持競爭力。主要亮點包括:

  • 程式碼與數學:整合 CodeQwen1.5 資料提升了程式設計能力。Qwen2-72B-Instruct 在 MATH 上取得 59.7 分,較 Llama-3-70B-Instruct 的 50.4 分更高。
  • 推理:模型在 Arena-Hard(48.1)和 MT-Bench(9.12)上表現出色。

小型與中型模型

Qwen2-7B-Instruct 超過相同規模的最先進模型,特別是在程式碼和中文相關指標上。Qwen2-0.5B 與 1.5B 亦較前一版本有所提升,其中 Qwen2-1.5B-Instruct 在 MMLU 上達到 52.4 分。

長上下文理解

所有指令微調模型皆在 32K 令牌上下文上進行預訓練。透過使用 YARN 與 Dual Chunk Attention,模型已被外推以處理更長的序列:

  • Qwen2-72B-Instruct 與 Qwen2-7B-Instruct:支援最高 128K 令牌,在「大海撈針」測試中展現近乎完美的資訊抽取。
  • Qwen2-57B-A14B-Instruct:支援最高 64K 令牌。
  • 小型模型(0.5B/1.5B):支援最高 32K 令牌。

安全性與多語言責任

Qwen2-72B-Instruct 的設計目標是有幫助、誠實且無害。在涉及多語言不安全查詢(非法活動、詐騙、色情與隱私暴力)的安全性評估中,Qwen2-72B-Instruct 的表現與 GPT-4 相當,且遠超過 Mistral-8x22B。例如,在「非法活動」類別中,Qwen2-72B-Instruct 在所有測試語言中保持 0% 有害回應率,與 GPT-4 相匹配。

授權與可用性

Qwen 已更新系列的授權,以促進更廣泛的商業採用:

  • Apache 2.0:適用於 Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B 與 Qwen2-57B-A14B。
  • 千問授權:保留給 Qwen2-72B 及其指令微調變體。

模型可於 Hugging Face 與 ModelScope 取得。

Sources