Qwen2.5-Max リリースノート

Qwenは、大規模なデータとモデルサイズを通じて知能をスケールさせるように設計された、大規模なMixture-of-Experts (MoE)モデルであるQwen2.5-Maxのリリースを発表しました。このモデルは、Qwen ChatインターフェイスおよびAlibaba Cloudが提供するOpenAI互換APIを通じて利用可能になりました。

モデルアーキテクチャとトレーニング

Qwen2.5-MaxはMixture-of-Experts (MoE)アーキテクチャに基づいて構築されています。20兆トークンを超えるデータセットで事前学習されました。能力を洗練させるため、キュレートされたスーパーバイズドファインチューニング (SFT)および人間フィードバックからの強化学習 (RLHF) 手法を用いたポストトレーニングが行われました。

パフォーマンスベンチマーク

Qwen2.5-Maxは、いくつかの主要なベンチマークにおいて、プロプライエタリおよびオープンウェイトモデルと競合するパフォーマンスを示しています。

Instruct Model Performance

GPT-4o、Claude-3.5-Sonnet、DeepSeek V3などの最先端モデルと比較したとき、Qwen2.5-Max Instructモデルは次の分野でDeepSeek V3を上回ります:

  • Arena-Hard
  • LiveBench
  • LiveCodeBench
  • GPQA-Diamond

また、大学レベルの知識をテストするMMLU-Proにおいても競争力のある結果を示しています。

Base Model Performance

ベースモデルの評価において、Qwen2.5-MaxはLlama-3.1-405B、Qwen2.5-72B、DeepSeek V3と比較されました。Qwenチームは、Qwen2.5-Maxベースモデルがこれらのベンチマークのほとんどにおいて大きな優位性を示していると報告しています。

可用性と統合

Qwen2.5-Max (モデル名 qwen-max-2025-01-25) は、以下の2つの主要なチャネルを通じてアクセス可能です:

  1. Qwen Chat: ユーザーはアーティファクトや検索などの機能を利用して、モデルと直接対話できます。
  2. Alibaba Cloud API: このAPIはOpenAI互換であり、開発者は標準のOpenAI Pythonライブラリを使用して、base_urlhttps://dashscope-intl.aliyuncs.com/compatible-mode/v1 に指向することでモデルを統合できます。

今後の研究方向性

Qwenは、スケールされた強化学習の応用に焦用に焦点を当て、大規模言語モデルの思考および推論能力をさらに向上させ、人間レベルの知能を超えるモデルを実現することを目指しています。

Sources