Qwen1.5-110B リリースノート / 新機能

Qwen は Qwen1.5-110B をリリースしました。これは Qwen1.5 シリーズで初めて 1000 億パラメータを超えるモデルです。このリリースは、モデルサイズの拡大がベース機能やチャットベースのインタラクションにおいて性能向上をもたらし続けることを示しており、Llama-3-70B などの他の大規模オープンソースモデルに対する競争力のある代替手段として位置付けられます。

モデルアーキテクチャと技術仕様

Qwen1.5-110B は Qwen1.5 シリーズの他のモデルと同様の Transformer デコーダーアーキテクチャを採用しています。主な技術仕様は以下の通りです。

  • Grouped Query Attention (GQA): モデルは GQA を組み込んで、モデル提供時の効率性を確保しています。
  • Context Window: 32K トークンのコンテキスト長をサポートします。
  • Multilingual Support: モデルは多言語対応を維持し、英語、中国語、フランス語、スペイン語、ドイツ語、ロシア語、韓国語、日本語、ベトナム語、アラビア語など幅広い言語をサポートします。

基本モデルの性能

Qwen1.5-110B は Meta-Llama3-70B および Mixtral-8x22B と複数のベンチマークで競合しています。Qwen チームは、事前学習および事後学習のレシピを大幅に変更せずに、モデルサイズを拡大することで Qwen1.5-72B モデルより性能が向上したと述べています。

ベンチマーク Qwen1.5-110B Qwen1.5-72B Llama-3-70B Mixtral-8x22B
MMLU 80.4 77.5 79.5 77.8
TheoremQA 34.9 29.3 32.0 35.9
GPQA 35.9 36.3 36.4 34.3
Hellaswag 87.5 86.0 88.0 88.7
BBH 74.8 65.5 76.6 69.2
ARC-C 69.6 65.9 68.8 70.7
GSM8K 85.4 79.5 79.2 78.6
MATH 49.6 34.1 41.0 41.7
HumanEval 52.4 41.5 45.7 45.1
MBPP 58.1 53.4 55.1 71.2

チャットモデル評価

チャット特化の評価において、Qwen1.5-110B-Chat は Qwen1.5-72B-Chat モデルに対して大幅な改善を示しています。MT-Bench と AlpacaEval 2.0 の両方で Llama-3-70B-Instruct を上回っています。

モデル MT-Bench(平均スコア) AlpacaEval 2.0(LC 勝率)
Llama-3-70B-Instruct 8.85 34.40
Qwen1.5-72B-Chat 8.61 36.60
Qwen1.5-110B-Chat 8.88 43.90

モデルスケーリングへの示唆

Qwen1.5-110B のリリースは、モデルサイズのスケーリングによって依然として大きな性能向上余地があることを示しています。Qwen チームは、Llama-3 が示したようにデータスケーリングの重要性も認識しており、今後のリリース(例:Qwen2)に向けてデータとモデルサイズの両方を拡大する戦略を追求する意向です。

Sources