Qwen1.5-32B リリースノート / 新機能

Qwenは、メモリ消費、推論レイテンシ、ファインチューニングコストを削減した大規模モデルの高性能代替として、Qwen1.5-32B と Qwen1.5-32B-Chat を導入しました。これらのモデルは、エージェントシナリオなどの複雑なタスクに対して14Bモデルでは不足し、72Bモデルはリソースが過剰になるユーザーにとって「ちょうど良い」ポイントとして位置付けられています。

技術アーキテクチャと効率性

Qwen1.5-32B は、Qwen1.5 シリーズ全体と同様の一般的なアーキテクチャを維持していますが、主な例外として Grouped Query Attention(GQA)を採用しています。GQA の実装により、標準的なアテンション機構と比較して、モデル提供がより効率的になり、推論性能が向上します。

パフォーマンスベンチマーク

Qwen1.5-32B は、ベース、チャット、マルチリンガル評価のすべてで競争力のある性能を示し、30B パラメータ領域の他のモデルをしばしば上回ります。

基本モデルの能力

ベース能力評価において、Qwen1.5-32B は多くのタスクで Llama2-34B と Mixtral-8x7B を上回ります。Qwen1.5-72B モデルよりはやや劣りますが、推論とコーディングベンチマークでは依然として高い競争力を保っています:

モデル MMLU C-Eval GSM8K MATH HumanEval MBPP BBH CMMLU
Qwen1.5-32B 73.4 83.5 77.4 36.1 37.2 49.4 66.8 82.3
Qwen1.5-72B 77.5 84.1 79.5 34.1 41.5 53.4 65.5 83.5
Mixtral-8x7B 70.6 - 74.4 28.4 40.2 60.7 - -
Yi-34B 76.3 81.4 67.2 14.4 23.2 41.0 54.3 83.7
Llama2-34B 62.6 - 42.2 6.2 22.6 33.0 44.1 -

チャットモデル評価

Qwen1.5-32B-Chat は、RLHF を含む高度な事後学習手法を活用して会話能力を向上させています。MT-Bench で 8 点以上のスコアを取得し、72B-Chat バリアントと比較しても性能差は比較的小さいです:

モデル MT-Bench(平均スコア) AlpacaEval 2.0(LC 勝率)
Qwen1.5-32B-Chat 8.30 27.49
Qwen1.5-72B-Chat 8.61 36.60

多言語および長コンテキスト性能

Qwen1.5-32B は、アラビア語、スペイン語、フランス語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、インドネシア語の計12言語をサポートしています。試験、理解、数学、翻訳の各分野での平均性能は 56.91 で、Mixtral-8x7B(50.39)より高く、Qwen1.5-72B(60.44)よりやや低いです。さらに、コンテキスト長が最大 32K トークンまでの「Needle in a Haystack」評価において、トップレベルの性能を達成しています。

Sources