Qwen1.5-MoE-A2.7B 版本說明

Qwen 已發布 Qwen1.5-MoE-A2.7B,一款小型的混合專家(MoE)模型,其效能與最先進的 7B 模型(如 Mistral 7B 與 Qwen1.5-7B)相當,但僅使用 27 億個啟用參數。此架構將訓練成本降低 75%,且相較於 Qwen1.5-7B,推理速度提升 1.74 倍。

MoE 架構增強

Qwen1.5-MoE-A2.7B 採用專門的 MoE 架構,改進了如 Mixtral 等模型使用的標準 top-2 gating 策略。此架構包含三項主要修改:

細粒度專家

Qwen 並非僅簡單複製前饋網路(FFN)層來產生專家,而是將單一 FFN 切分為多個段。此方法在不增加總參數量的情況下產生更多專家。模型使用 64 個專家,是傳統 8 專家 MoE 設定的 8 倍。

再利用初始化

為避免從頭訓練的低效率,模型透過再利用現有的 Qwen-1.8B 模型進行初始化。研究人員發現,在此「再利用」初始化階段加入隨機性,可顯著加速收斂並提升預訓練期間的整體效能。

共享與路由專家

路由機制採用結合共享與路由專家的通用方法。Qwen1.5-MoE-A2.7B 使用 4 個始終啟用的共享專家,另有 60 個路由專家,每個 token 會啟用其中 4 個。此配置較傳統 MoE 路由提供更高的彈性與效率。

效能基準

Qwen1.5-MoE-A2.7B 在語言理解、數學與程式碼基準測試中展現競爭力,表現與密集 7B 模型相似。

模型 MMLU GSM8K HumanEval 多語言 MT-Bench
Mistral-7B 64.1 47.5 27.4 40.0 7.60
Gemma-7B 64.6 50.9 32.3 - -
Qwen1.5-7B 61.0 62.5 36.0 45.2 7.60
DeepSeekMoE 16B 45.0 18.8 26.8 - 6.93
Qwen1.5-MoE-A2.7B 62.5 61.5 34.2 40.8 7.17

雖然基礎模型與 7B 模型相當,團隊指出仍有未開發的潛力可透過精細的微調策略提升聊天模型的效能。

訓練與推理效率

相較於密集模型,MoE 架構僅啟用部分總參數,顯著降低計算負擔。

參數比較

Qwen1.5-MoE-A2.7B 總參數為 143 億,但在前向傳播時僅啟用 27 億。其非嵌入參數數量(20 億)約為 Qwen1.5-7B(64 億)的三分之一。

成本與速度提升

  • 訓練成本: 與 Qwen1.5-7B 相比,模型的訓練費用降低了 75%,部分原因是再利用省去了與原模型相同量級的 token 訓練需求。
  • 推理速度: 在單張 NVIDIA A100-80G GPU 上使用 vLLM(1000 輸入與 1000 輸出 token)測試,Qwen1.5-MoE-A2.7B-Chat 的吞吐量為每秒 2.01 個請求、4010.27 token/秒(TPS)。相較於 Qwen1.5-7B-Chat(1.15 吞吐量、2298.89 TPS),提升了 1.74 倍。

部署與整合

Qwen1.5-MoE 已整合至 Hugging Face transformers 函式庫與 vLLM。由於 qwen2_moe 實作尚未在 transformers 的主 pip/conda 版本中提供,使用者必須從原始碼安裝函式庫:

git clone https://github.com/huggingface/transformers
cd transformers
pip install -e .

若要進行量化部署,可使用 Qwen1.5-MoE-A2.7B-Chat-GPTQ-Int4 模型,但目前尚未支援 AWQ。

Sources