Qwen1.5-MoE-A2.7B リリースノート
Qwenは、Qwen1.5-MoE-A2.7Bという小型のMixture-of-Experts(MoE)モデルをリリースしました。このモデルは、Mistral 7BやQwen1.5-7Bなどの最先端7Bモデルと同等の性能を持ちつつ、アクティブ化されたパラメータはわずか27億しか使用しません。このアーキテクチャは、トレーニングコストを75%削減し、Qwen1.5-7Bと比較して推論速度を1.74倍向上させます。
MoE アーキテクチャの強化
Qwen1.5-MoE-A2.7Bは、Mixtralなどのモデルで使用される標準的なトップ2ゲーティング戦略を改良した、特殊なMoEアーキテクチャを採用しています。このアーキテクチャは、主に3つの変更点を組み込んでいます:
細粒度エキスパート
エキスパートを作成するために単にフィードフォワードネットワーク(FFN)層を複製するのではなく、Qwenは単一のFFNを複数のセグメントに分割します。この手法により、総パラメータ数を増やすことなくエキスパート数を大幅に増やすことができます。モデルは64個のエキスパートを使用しており、従来の8エキスパートMoE構成の8倍に相当します。
アップサイクリング初期化
スクラッチからのトレーニングに伴う非効率性を回避するため、既存のQwen-1.8Bモデルを再利用して初期化されました。研究者は、この「アップサイクリング」初期化段階でランダム性を導入することで、収束が大幅に加速し、事前学習中の全体的な性能が向上することを発見しました。
共有エキスパートとルーティングエキスパート
ルーティング機構は、共有エキスパートとルーティング専用エキスパートを組み合わせた汎用的なアプローチを採用しています。Qwen1.5-MoE-A2.7Bは常にアクティブになる4つの共有エキスパートと、60のルーティングエキスパートを使用し、そのうち4つがトークンごとにアクティブ化されます。この構成は、従来のMoEルーティングに比べて柔軟性と効率性を向上させます。
パフォーマンスベンチマーク
Qwen1.5-MoE-A2.7Bは、言語理解、数学、コーディングのベンチマークにおいて競争力のある性能を示し、密結合の7Bモデルと同等の結果を出しています。
| モデル | MMLU | GSM8K | HumanEval | 多言語 | MT-Bench |
|---|---|---|---|---|---|
| Mistral-7B | 64.1 | 47.5 | 27.4 | 40.0 | 7.60 |
| Gemma-7B | 64.6 | 50.9 | 32.3 | - | - |
| Qwen1.5-7B | 61.0 | 62.5 | 36.0 | 45.2 | 7.60 |
| DeepSeekMoE 16B | 45.0 | 18.8 | 26.8 | - | 6.93 |
| Qwen1.5-MoE-A2.7B | 62.5 | 61.5 | 34.2 | 40.8 | 7.17 |
ベースモデルは7Bモデルと同等の性能を示していますが、チームは、洗練されたファインチューニング戦略を通じてチャットモデルの性能をさらに向上させる余地がまだあることを指摘しています。
トレーニングと推論の効率性
MoEアーキテクチャは、総パラメータのごく一部のみをアクティブ化することで、密結合モデルに比べて計算オーバーヘッドを大幅に削減します。
パラメータ比較
Qwen1.5-MoE-A2.7Bは総パラメータが143億ありますが、フォワードパス時にアクティブになるのは27億だけです。埋め込み以外のパラメータ数(20億)は、Qwen1.5-7B(64億)の約3分の1に相当します。
コストと速度の向上
- Training Costs: モデルは、Qwen1.5-7Bと比較してトレーニングコストを75%削減しました。これは、アップサイクリングにより元のモデルと同等のトークン量でのトレーニングが不要になったことが一因です。
- Inference Speed: 単一の NVIDIA A100-80G GPU上で vLLM を使用(入力トークン1000、出力トークン1000)してテストしたところ、Qwen1.5-MoE-A2.7B-Chat は秒間 2.01 リクエスト、4010.27 トークン/秒(TPS)のスループットを達成しました。これは、Qwen1.5-7B-Chat の 1.15 リクエスト/秒、2298.89 TPS に比べて 1.74 倍高速です。
デプロイと統合
Qwen1.5-MoE は Hugging Face の transformers ライブラリと vLLM に統合されています。qwen2_moe の実装はまだ transformers のメインの pip/conda リリースに含まれていないため、ユーザーはソースからライブラリをインストールする必要があります:
git clone https://github.com/huggingface/transformers
cd transformers
pip install -e .
量子化されたデプロイのために、Qwen1.5-MoE-A2.7B-Chat-GPTQ-Int4 モデルが利用可能ですが、現在のところ AWQ はサポートされていません。