Qwen2 リリースノート / 新機能

QwenはQwen2をリリースしました。これはQwen1.5シリーズの進化版で、5つのモデルサイズ(0.5B、1.5B、7B、57B‑A14B、72B)を備え、コーディング、数学、そして多言語理解のパフォーマンス向上を目指しています。すべてのサイズでGroup Query Attention(GQA)を採用し、推論速度とメモリ使用量を最適化するとともに、英語と中国語に加えて27の追加言語でトレーニングデータを拡張しました。

モデルアーキテクチャと仕様

Qwen2は、パラメータ数とコンテキストウィンドウの能力が異なるベースモデルと指示チューニングモデルのラインナップを導入します。主なアーキテクチャ更新は、すべてのモデルサイズでのGroup Query Attention(GQA)の汎用実装で、メモリオーバーヘッドを削減し、推論速度を向上させます。

Model Parameters Non-Embedding Params GQA Tie Embedding Context Length
Qwen2-0.5B 0.49B 0.35B True True 32K
Qwen2-1.5B 1.54B 1.31B True True 32K
Qwen2-7B 7.07B 5.98B True False 128K
Qwen2-57B-A14B 57.41B 56.32B True False 64K
Qwen2-72B 72.71B 70.21B True False 128K

小規模モデル(0.5B と 1.5B)では、埋め込みパラメータが総パラメータ数を支配しないように、埋め込みを結合(tied)しています。

多言語拡張とコードスイッチング

Qwen2は、グローバルでの有用性を高めるために27の追加言語でトレーニングされています。この拡張は以下の主要地域をカバーします。

  • 西ヨーロッパ: ドイツ語、フランス語、スペイン語、ポルトガル語、イタリア語、オランダ語
  • 東・中ヨーロッパ: ロシア語、チェコ語、ポーランド語
  • 中東: アラビア語、ペルシア語、ヘブライ語、トルコ語
  • 東アジア: 日本語、韓国語
  • 東南アジア: ベトナム語、タイ語、インドネシア語、マレー語、ラオ語、ビルマ語、セブアノ語、クメール語、タガログ語
  • 南アジア: ヒンディー語、ベンガル語、ウルドゥー語

言語を追加しただけでなく、チームは「コードスイッチング」(単一プロンプト内で複数言語を混在させること)への対応力向上にも注力し、多言語評価におけるエラーを大幅に削減しました。

パフォーマンスベンチマーク

大規模モデルパフォーマンス(Qwen2-72B)

Qwen2-72Bは、パラメータ数が少ないにもかかわらず、前世代のQwen1.5-110Bを上回る性能を示します。ベースモデル評価では、Llama-3-70Bを複数の指標で上回り、MMLU(84.2 対 79.5)やHumanEval(64.6 対 48.2)で優れた結果を出しています。

指示チューニングモデルの能力

Qwen2-72B-Instructは、Qwen1.5-72B-Chatを大幅に上回り、Llama-3-70B-Instructと競合します。主なハイライトは次のとおりです。

  • コーディングと数学: CodeQwen1.5 データの統合によりプログラミング能力が向上。Qwen2-72B-Instruct は MATH で 59.7 点を取得し、Llama-3-70B-Instruct の 50.4 点を上回ります。
  • 推論: Arena-Hard(48.1)と MT‑Bench(9.12)で高いパフォーマンスを示します。

小型・中型モデル

Qwen2-7B-Instruct は、同等サイズの最先端モデルを上回り、特にコーディングと中国語関連指標で優れています。Qwen2-0.5B と 1.5B も前バージョンに比べて改善され、Qwen2-1.5B-Instruct は MMLU で 52.4 点を記録しています。

長文コンテキスト理解

すべての指示チューニングモデルは 32K トークンのコンテキストで事前学習されています。YARN と Dual Chunk Attention を活用し、以下のように長いシーケンスにも対応できるよう拡張されています。

  • Qwen2-72B-Instruct と Qwen2-7B-Instruct: 最大 128K トークンをサポートし、"Needle in a Haystack" テストでほぼ完璧な情報抽出を実現。
  • Qwen2-57B-A14B-Instruct: 最大 64K トークンをサポート。
  • 小型モデル(0.5B/1.5B): 最大 32K トークンをサポート。

安全性と多言語に対する責任

Qwen2-72B-Instruct は、役に立ち、正直で、害を与えないことを目指して設計されています。多言語の安全性評価(違法行為、詐欺、ポルノ、プライバシー侵害)において、Qwen2-72B-Instruct は GPT‑4 と同等の性能を示し、Mistral-8x22B を大きく上回りました。たとえば "違法行為" カテゴリでは、テストしたすべての言語で有害な応答率が 0% で、GPT‑4 と同等でした。

ライセンスと提供方法

Qwenはシリーズのライセンスを更新し、商用採用の拡大を促進しています。

  • Apache 2.0: Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B、Qwen2-57B-A14B に適用。
  • Qianwen License: Qwen2-72B とその指示チューニングバリアントに保持。

モデルは Hugging Face と ModelScope で入手可能です。

Sources