Qwen2.5 リリースノート:新しい基盤、Coder、Math モデル

Qwen は、汎用言語モデル、コーディング用の専門モデル(Qwen2.5-Coder)および数学用の専門モデル(Qwen2.5-Math)を含む多様なラインナップと、強化された Qwen2-VL-72B ビジョン・ランゲージモデルを特徴とする大規模なオープンソースアップデートである Qwen2.5 のリリースを発表しました。

Qwen2.5 汎用言語モデル

Qwen2.5 は、0.5B、1.5B、3B、7B、14B、32B、72B のサイズで、密集したデコーダーオンリーモデルの幅広いラインナップを導入します。これらのモデルは最大 18 兆トークンの大規模データセットで事前学習されており、Qwen2 に比べて知識の向上と能力の改善が顕著です。

主な技術的能力

  • Knowledge and Reasoning: モデルは一般知識 (MMLU: 85+)、コーディング (HumanEval 85+)、数学 (MATH 80+) において性能が向上しています。
  • Context and Generation: Qwen2.5 は最大 128K トークンのコンテキストウィンドウをサポートし、最大 8K トークンの生成が可能です。
  • Structured Data: テーブルなどの構造化データの理解と、特に JSON 形式での構造化出力の生成において大幅な改善が見られます。
  • Instruction Following: モデルは多様なシステムプロンプトに対してより耐性があり、ロールプレイやチャットボットの条件設定での有用性が向上しています。
  • Multilingual Support: モデルは英語、中国語、フランス語、スペイン語、ポルトガル語、ドイツ語、イタリア語、ロシア語、日本語、韓国語、ベトナム語、タイ語、アラビア語など、29 以上の言語をサポートします。

パフォーマンスベンチマーク

  • Qwen2.5-72B: このフラッグシップのオープンソースモデルは Llama-3.1-70B や Mistral-Large-V2 と競合します。Qwen2.5-72B のベースモデルは、Llama-3-405B のようなより大規模なモデルに対してもトップクラスの性能を達成すると報告されています。
  • Mid-Sized Models (14B and 32B): Qwen2.5-14B と Qwen2.5-32B は、サイズと能力のバランスを提供するために再導入され、Phi-3.5-MoE-Instruct や Gemma2-27B-IT などのベースラインモデルを上回ります。
  • Small Language Models (SLMs): Qwen2.5-3B は高い知識密度を示し、パラメータ数が小さいにもかかわらず、競争力のある結果(MMLU スコア 65 以上)を達成しています。
  • API-based Models: Qwen-Plus は Llama-3.1-405B と競合し、DeepSeek-V2.5 を大幅に上回りますが、いくつかの領域では GPT-4o と Claude-3.5-Sonnet にまだ劣ります。Qwen-Turbo はコスト効率が高く、迅速なサービスを提供します。

専門エキスパートモデル

Qwen は、高性能な技術タスク向けに設計された 2 つの専門モデルファミリーをリリースしました。

Qwen2.5-Coder

デバッグ、コード提案、プログラミング質問への回答を目的として設計された Qwen2.5-Coder は、コード関連データ 5.5 兆トークンで学習されています。1.5B、7B、そして 32B(近日リリース)サイズで提供されます。7B-Instruct バージョンは、さまざまなプログラミング言語において多くの大規模言語モデルを上回ると評価されています。

Qwen2.5-Math

1.5B、7B、72B のサイズで提供される Qwen2.5-Math は、Qwen2-Math が生成した合成データを含む、より大規模な数学関連データで事前学習されています。中国語と英語の両方をサポートし、以下の推論手法を利用します:

  • Chain-of-Thought (CoT)
  • Program-of-Thought (PoT)
  • Tool-Integrated Reasoning (TIR)

Qwen2.5-Math-72B-Instruct モデルは、一般的な性能において Qwen2-Math-72B-Instruct と GPT-4o の両方を上回ると報告されています。

デプロイとツール統合

Qwen2.5 モデルは、デプロイと推論のための主要な業界フレームワークと互換性があります:

  • Hugging Face: Transformers ライブラリを通じてサポートされています。
  • vLLM: OpenAI API 互換サービスと組み込みツール呼び出しをサポートします(vLLM >= 0.6 が必要)。Nous Hermes に触発されたテンプレートを使用します。
  • Ollama: OpenAI 互換サービスを通じてツール呼び出しをサポートします。
  • Tool Calling Templates: チャットテンプレートは Hugging Face transformers 用のツール呼び出しサポートを含み、Qwen2 テンプレートと Qwen-Agent との下位互換性も維持しています。

ライセンスと入手可能性

3B と 72B のバリアントを除き、Qwen2.5 リリースのすべてのオープンソースモデルは Apache 2.0 ライセンスで提供されています。

Sources