Qwen2 リリースノート / 新機能
QwenはQwen2をリリースしました。これはQwen1.5シリーズの進化版で、5つのモデルサイズ(0.5B、1.5B、7B、57B‑A14B、72B)を備え、コーディング、数学、そして多言語理解のパフォーマンス向上を目指しています。すべてのサイズでGroup Query Attention(GQA)を採用し、推論速度とメモリ使用量を最適化するとともに、英語と中国語に加えて27の追加言語でトレーニングデータを拡張しました。
モデルアーキテクチャと仕様
Qwen2は、パラメータ数とコンテキストウィンドウの能力が異なるベースモデルと指示チューニングモデルのラインナップを導入します。主なアーキテクチャ更新は、すべてのモデルサイズでのGroup Query Attention(GQA)の汎用実装で、メモリオーバーヘッドを削減し、推論速度を向上させます。
| Model | Parameters | Non-Embedding Params | GQA | Tie Embedding | Context Length |
|---|---|---|---|---|---|
| Qwen2-0.5B | 0.49B | 0.35B | True | True | 32K |
| Qwen2-1.5B | 1.54B | 1.31B | True | True | 32K |
| Qwen2-7B | 7.07B | 5.98B | True | False | 128K |
| Qwen2-57B-A14B | 57.41B | 56.32B | True | False | 64K |
| Qwen2-72B | 72.71B | 70.21B | True | False | 128K |
小規模モデル(0.5B と 1.5B)では、埋め込みパラメータが総パラメータ数を支配しないように、埋め込みを結合(tied)しています。
多言語拡張とコードスイッチング
Qwen2は、グローバルでの有用性を高めるために27の追加言語でトレーニングされています。この拡張は以下の主要地域をカバーします。
- 西ヨーロッパ: ドイツ語、フランス語、スペイン語、ポルトガル語、イタリア語、オランダ語
- 東・中ヨーロッパ: ロシア語、チェコ語、ポーランド語
- 中東: アラビア語、ペルシア語、ヘブライ語、トルコ語
- 東アジア: 日本語、韓国語
- 東南アジア: ベトナム語、タイ語、インドネシア語、マレー語、ラオ語、ビルマ語、セブアノ語、クメール語、タガログ語
- 南アジア: ヒンディー語、ベンガル語、ウルドゥー語
言語を追加しただけでなく、チームは「コードスイッチング」(単一プロンプト内で複数言語を混在させること)への対応力向上にも注力し、多言語評価におけるエラーを大幅に削減しました。
パフォーマンスベンチマーク
大規模モデルパフォーマンス(Qwen2-72B)
Qwen2-72Bは、パラメータ数が少ないにもかかわらず、前世代のQwen1.5-110Bを上回る性能を示します。ベースモデル評価では、Llama-3-70Bを複数の指標で上回り、MMLU(84.2 対 79.5)やHumanEval(64.6 対 48.2)で優れた結果を出しています。
指示チューニングモデルの能力
Qwen2-72B-Instructは、Qwen1.5-72B-Chatを大幅に上回り、Llama-3-70B-Instructと競合します。主なハイライトは次のとおりです。
- コーディングと数学: CodeQwen1.5 データの統合によりプログラミング能力が向上。Qwen2-72B-Instruct は MATH で 59.7 点を取得し、Llama-3-70B-Instruct の 50.4 点を上回ります。
- 推論: Arena-Hard(48.1)と MT‑Bench(9.12)で高いパフォーマンスを示します。
小型・中型モデル
Qwen2-7B-Instruct は、同等サイズの最先端モデルを上回り、特にコーディングと中国語関連指標で優れています。Qwen2-0.5B と 1.5B も前バージョンに比べて改善され、Qwen2-1.5B-Instruct は MMLU で 52.4 点を記録しています。
長文コンテキスト理解
すべての指示チューニングモデルは 32K トークンのコンテキストで事前学習されています。YARN と Dual Chunk Attention を活用し、以下のように長いシーケンスにも対応できるよう拡張されています。
- Qwen2-72B-Instruct と Qwen2-7B-Instruct: 最大 128K トークンをサポートし、"Needle in a Haystack" テストでほぼ完璧な情報抽出を実現。
- Qwen2-57B-A14B-Instruct: 最大 64K トークンをサポート。
- 小型モデル(0.5B/1.5B): 最大 32K トークンをサポート。
安全性と多言語に対する責任
Qwen2-72B-Instruct は、役に立ち、正直で、害を与えないことを目指して設計されています。多言語の安全性評価(違法行為、詐欺、ポルノ、プライバシー侵害)において、Qwen2-72B-Instruct は GPT‑4 と同等の性能を示し、Mistral-8x22B を大きく上回りました。たとえば "違法行為" カテゴリでは、テストしたすべての言語で有害な応答率が 0% で、GPT‑4 と同等でした。
ライセンスと提供方法
Qwenはシリーズのライセンスを更新し、商用採用の拡大を促進しています。
- Apache 2.0: Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B、Qwen2-57B-A14B に適用。
- Qianwen License: Qwen2-72B とその指示チューニングバリアントに保持。
モデルは Hugging Face と ModelScope で入手可能です。
Sources
- OriginalHello Qwen2