Qwen2.5 LLMシリーズリリース
TL;DR
QwenはQwen2.5シリーズを発表しました – 0.5Bから72Bパラメータまでのデコーダー専用LLMのファミリーで、前世代のQwen2モデルに比べ最大で2倍の性能を持ち、3B、14B、32Bサイズは完全にオープンソースです。アップグレードには、18兆トークン規模の大規模事前学習コーパス、知識・コーディング・数学・アラインメントの大幅な向上、最大128Kトークンのコンテキストウィンドウが含まれます。
Qwen2.5リリースの概要
- モデルラインナップ – 7つのオープンソースモデル(0.5B、1.5B、3B、7B、14B、32B、72B)。3B、14B、32Bのチェックポイントは、プロダクション向け(10‑30B)およびモバイル向け(≈3B)ワークロードの需要に応えるために新たに追加されました。
- ライセンス – すべてのモデルはApache‑2.0ですが、Qwen2.5‑3BはQwen Research License、Qwen2.5‑72BはQwen Licenseです。
- コンテキストと生成 – コンテキスト長は最大128 Kトークン、生成長は最大8 Kトークンで、長文出力が可能です。
- アクセス – オープンソースチェックポイントに加えて、Qwen‑Plus と Qwen‑Turbo がAlibaba Cloud Model Studio APIで提供されます。
Qwen2に対する技術的改善点
| アップグレード | 詳細 |
|---|---|
| データセットサイズ | 事前学習データは7 Tトークンから最大 18 Tトークン に増加しました。 |
| 知識 | MMLUスコアが70.3 → 74.2(7B)および84.2 → 86.1(72B)に上昇。GPQA、MMLU‑Pro、MMLU‑Redux、ARC‑Cでも改善が見られます。 |
| コーディング | Qwen2.5‑Coder を導入。Qwen2.5‑72B‑Instruct のスコアは LiveCodeBench で55.5、MultiPL‑Eで75.1、MBPPで88.2 と、Qwen2‑72B‑Instruct(32.2、69.2、80.2)を上回ります。 |
| 数学 | Qwen2‑math 技術を統合。MATHベンチマークは 75.5(7B)および 83.1(72B)に跳躍し、以前の52.9 / 69.0から大幅に向上しました。 |
| アラインメント | Arena‑Hard スコアが48.1 → 81.2、MT‑Bench が9.12 → 9.35 に上昇(72B インストラクションモデル)。 |
| その他の機能 | 指示遵守、長文生成(1 K → 8 K トークン)、テーブル理解、JSON生成、さまざまなシステムプロンプトへのロバスト性がすべて顕著に向上。 |
モデルカードのハイライト
| モデル | パラメータ | 層 | ヘッド (KV) | コンテキスト | 生成 | ライセンス |
|---|---|---|---|---|---|---|
| Qwen2.5‑0.5B | 0.49 B | 24 | 14/2 | 32 K | 8 K | Apache 2.0 |
| Qwen2.5‑1.5B | 1.54 B | 28 | 12/2 | 32 K | 8 K | Apache 2.0 |
| Qwen2.5‑3B | 3.09 B | 36 | 16/2 | 32 K | 8 K | Qwen Research |
| Qwen2.5‑7B | 7.61 B | 28 | 28/4 | 128 K | 8 K | Apache 2.0 |
| Qwen2.5‑14B | 14.7 B | 48 | 40/8 | 128 K | 8 K | Apache 2.0 |
| Qwen2.5‑32B | 32.5 B | 64 | 40/8 | 128 K | 8 K | Apache 2.0 |
| Qwen2.5‑72B | 72.7 B | 80 | 64/8 | 128 K | 8 K | Qwen |
ベンチマーク性能 – 基本モデル
72B モデル
Qwen2.5‑72B は全体的に競合モデルを上回り、パラメータが約1/5であるにもかかわらず Llama‑3‑405B に匹敵するスコアを達成しています。ハイライト:
- MMLU: 86.1(Qwen2‑72B の84.2、Llama‑3‑405B の85.2 と比較)
- BBH: 86.3(Qwen2‑72B の82.4 と比較)
- GPQA: 45.9(37.4 と比較)
- MATH: 62.1(50.9 と比較)
- HumanEval: 59.1(Qwen2‑72B の64.6 と比較、ただし多くのオープンモデルより高い)
- 多言語: Multi‑Exam で最高 78.7、Multi‑Understanding で最高 89.6 を記録。
中規模モデル
- Qwen2.5‑14B は Qwen1.5‑32B および他の 14‑30B オープンモデルを MMLU(79.7)と BBH(78.2)で上回ります。
- Qwen2.5‑32B は Qwen2‑57B‑A14B を超え、Llama‑3‑70B レベルの性能を多くのタスクで達成(例: MMLU 83.3、GSM8K 92.9、MBPP 84.5)。
7B モデル
Qwen2.5‑7B はパラメータ数が同等(6.5 B)であるにもかかわらず Qwen2‑7B を上回り、主なスコアは MMLU 74.2、MATH 49.8、HumanEval 57.9 です。
エッジ側モデル(≤3B)
0.5B、1.5B、3B のすべてのモデルが Qwen2 系列に対して一貫した改善を示し、特にコーディング(例: HumanEval 42.1 → 74.4(3B))と数学(MATH 19.5 → 42.6(3B))で顕著です。
指示チューニング済みモデル
Qwen2.5‑72B‑Instruct
- Arena‑Hard: 81.2(Qwen2‑72B‑Instruct の48.1 と比較)
- MATH: 83.1(69.0 と比較)
- LiveCodeBench: 55.5(32.2 と比較)
- MT‑Bench: 9.35(9.12 と比較)
- 複数の指標で Llama‑3.1‑405B‑Instruct を上回ります(例: MMLU‑Pro 71.1 対 Llama‑3.1‑405B‑Instruct の73.3)。
Qwen‑Turbo、Qwen2.5‑14B‑Instruct、Qwen2.5‑32B‑Instruct
- Qwen2.5‑32B‑Instruct は同等サイズのオープンモデルの中で最高スコアを記録(例: MMLU‑Pro 69.0、GSM8K 95.9、HumanEval 88.4)。
- Qwen‑Turbo(API)は多くのベンチマークで GPT‑4o‑mini に匹敵する競争力のある結果を提供しつつ、オープンソースであり続けます。
7B、3B、1.5B、0.5B 指示モデル
すべての小型指示モデルはベースバージョンに対して大幅な相対改善を示し、リソース制約のある展開に適しています。主な例:
- Qwen2.5‑7B‑Instruct: MATH 75.5、HumanEval 84.8。
- Qwen2.5‑3B‑Instruct: コーディング(HumanEval 74.4)と数学(MATH 65.9)で、より大きな商用モデルに匹敵。
- Qwen2.5‑1.5B‑Instruct: HumanEval 61.6、MATH 55.2 – Qwen2‑1.5B‑Instruct から20ポイント以上のジャンプ。
多言語能力
シリーズは翻訳版 IFEval、言語別 MMLU バリアント、拡張 MGSM8K、文化的ニュアンスベンチマーク BLEnD で評価されました。72B 指示モデルは競合相手の中で最も高い多言語スコアを取得(例: 多言語 IFEval で 86.98、日本語 JMMLU で 80.56)。14B と 7B の指示モデルも多くの言語で大規模商用システムに近い性能を示します。
新機能のデモンストレーション
- JSON生成 – モデルは構文的に正しい JSON 構造を安定して出力し、ツール呼び出しパイプラインに有用です。
- 長文生成 – 8 K トークンの生成上限により、エッセイ、レポート、コードベースを切れ目なく生成可能です。
- 構造化データ理解 – テーブル解析とマルチカラム推論が大幅に改善され、デモスイートで実証されています。
LLM領域への影響
- オープンソースの競争力 – 14B と 32B のチェックポイントが多くの商用モデルを上回ることで、オープンとクローズドのエコシステム間のギャップが縮小します。
- 本番向けミドルティア – 10‑30B の範囲が完全にオープンモデルでカバーされ、セルフホスト型 LLM を求める企業の参入障壁が低下します。
- エッジ展開 – 3B モデルはモバイルや組み込みデバイスに適したフットプリントで、強力なコーディングと数学能力を提供します。
- アラインメントの進展 – Arena‑Hard と MT‑Bench の大幅な向上は、オープンソースの指示チューニングが最先端のクローズドモデルに匹敵する人間好みのアラインメントを実現できることを示しています。
モデルの入手先
- GitHub – https://github.com/QwenLM/Qwen2.5
- Hugging Face – https://huggingface.co/Qwen
- ModelScope – https://modelscope.cn/organization/qwen
- デモ – https://huggingface.co/spaces/Qwen/Qwen2.5-72B-Instruct
- API(Qwen‑Turbo、Qwen‑Plus) – Alibaba Cloud Model Studio。
すべての数値と表は Qwen2.5 の公式発表からそのまま転載しており、追加の主張は行っていません。