Qwen1.5-MoE-A2.7B 发布说明

Qwen 已发布 Qwen1.5-MoE-A2.7B,这是一款小型的混合专家(Mixture-of-Experts,MoE)模型,能够匹配最先进的 7B 模型(如 Mistral 7B 和 Qwen1.5-7B)的性能,同时仅使用 27 亿激活参数。该架构实现了训练成本降低 75%,并且相较于 Qwen1.5-7B 推理速度提升 1.74 倍。

MoE 架构增强

Qwen1.5-MoE-A2.7B 采用了专门的 MoE 架构,改进了类似 Mixtral 模型中使用的标准 top‑2 gating 策略。该架构包含以下三项主要修改:

细粒度专家

与简单地复制前馈网络(FFN)层来创建专家不同,Qwen 将单个 FFN 划分为多个段。此方法在不增加总体参数量的前提下,生成了更多的专家。模型使用 64 个专家,是传统 8‑expert MoE 设置的 8 倍。

再利用初始化(Upcycling Initialization)

为避免从零开始训练的低效,模型通过再利用已有的 Qwen‑1.8B 模型进行初始化。研究人员发现,在此“再利用”初始化阶段引入随机性显著加快了收敛速度,并提升了预训练期间的整体性能。

共享与路由专家

路由机制采用了将共享专家与路由专用专家相结合的通用方法。Qwen1.5-MoE-A2.7B 使用 4 个始终激活的共享专家,以及 60 个路由专家,其中每个 token 激活 4 个。这种配置比传统 MoE 路由提供了更大的灵活性和效率。

性能基准

Qwen1.5-MoE-A2.7B 在语言理解、数学和代码基准上表现出竞争力,性能与密集型 7B 模型相当。

模型 MMLU GSM8K HumanEval 多语言 MT-Bench
Mistral-7B 64.1 47.5 27.4 40.0 7.60
Gemma-7B 64.6 50.9 32.3 - -
Qwen1.5-7B 61.0 62.5 36.0 45.2 7.60
DeepSeekMoE 16B 45.0 18.8 26.8 - 6.93
Qwen1.5-MoE-A2.7B 62.5 61.5 34.2 40.8 7.17

虽然基础模型已与 7B 模型持平,团队仍指出通过更精细的微调策略,聊天模型的性能仍有未开发的提升空间。

训练与推理效率

相较于密集模型,MoE 架构通过仅激活部分参数显著降低了计算开销。

参数对比

Qwen1.5-MoE-A2.7B 总参数量为 143 亿,但在前向传播时仅激活 27 亿。其非嵌入参数量(20 亿)约为 Qwen1.5-7B(64 亿)的三分之一。

成本与速度提升

  • 训练成本: 与 Qwen1.5-7B 相比,模型实现了 75% 的训练费用下降,部分原因是再利用(upcycling)消除了对原模型相同 token 量的训练需求。
  • 推理速度: 在单块 NVIDIA A100‑80G GPU 上使用 vLLM(输入 1000 token,输出 1000 token)进行测试,Qwen1.5-MoE-A2.7B-Chat 的吞吐量为 2.01 请求/秒,4010.27 token/秒(TPS),比 Qwen1.5-7B-Chat(1.15 吞吐量,2298.89 TPS)快 1.74 倍。

部署与集成

Qwen1.5-MoE 已与 Hugging Face transformers 库和 vLLM 集成。由于 qwen2_moe 实现尚未在 transformers 的主 pip/conda 发布版中,用户需从源码安装该库:

git clone https://github.com/huggingface/transformers
cd transformers
pip install -e .

对于量化部署,可使用 Qwen1.5-MoE-A2.7B-Chat-GPTQ-Int4 模型,当前尚不支持 AWQ。

SUMMARY: Qwen 引入了 Qwen1.5-MoE-A2.7B,这是一款 Mixture-of-Experts 模型,能够在仅使用 27 亿激活参数的情况下匹配 7B 密集模型的性能。

TITLE: Qwen1.5-MoE-A2.7B 发布说明

Sources