Qwen2.5-Coder リリースノート

Qwenは、アジャイルなコーディングパートナーとして機能する次世代のオープンソースコーディングモデルシリーズであるQwen2.5-Coderのリリースを発表しました。このシリーズは1.5Bと7Bのサイズで提供され、32Bバージョンは今後リリース予定です。

技術的基盤とトレーニング

Qwen2.5-CoderはQwen2.5ベースの上に構築され、5.5兆トークンの大規模データセットで学習されています。このトレーニングコーパスには、ソースコード、合成データ、テキストとコードのグラウンディングデータが含まれ、専門的なコーディング能力を強化します。モデルがCode Agentsのような実世界のアプリケーションでも汎用性を保つよう、数学や一般的な能力に焦点を当てた追加データも取り入れられました。

ベースモデルの能力

Qwen2.5-Coderのベースモデルは最大128Kトークンのコンテキストウィンドウをサポートし、92のプログラミング言語に対応しています。これらのモデルは複数の主要領域で大幅な改善を示しています。

  • コードタスク: モデルはコード生成、マルチプログラミングコード生成、コード補完、コード修正に優れています。
  • 競争力のある性能: Qwen2.5-Coderの7Bバージョンは、特にDeepSeek-Coder-V2-LiteやCodeStral-22Bといった大規模モデルを、さまざまなコード関連評価タスクで上回ります。
  • 汎用的な熟練度: モデルはMMLUやARCでの評価に示されるように、Qwen2.5の一般的な能力パフォーマンスを保持しつつ、GSM8KやMathといった数学ベンチマークでも競争力があります。

Qwen2.5-Coder-Instruct の強化

Qwen2.5-Coder-Instructはベースモデルの指示チューニング版で、ベンチマーク全体でタスク性能と汎化能力が向上しています。

マルチプログラミングと推論

McEvalを使用して40以上のプログラミング言語をカバーし、Qwen2.5-Coder-Instructは人気言語とニッチ言語の両方でエキスパートであることが証明されています。さらに、CRUXEvalによる評価は、モデルがコード推論に優れていることを示しています。開発者は、コード推論の向上と複雑な指示に従う能力の向上との相関関係を指摘しました。

数学と汎用知能

Qwen2.5-Coder-Instructは「理系学生」として高い性能を示し、数学的基礎とコーディングツールのギャップを埋めます。DeepSeek-Coder-V2-Lite-Instructとの直接比較において、Qwen2.5-Coder-7B-Instructモデルは複数のベンチマークで優れた結果を示しました。

ベンチマーク Qwen2.5-Coder-7B-Instruct DeepSeek-Coder-V2-Lite-Instruct
数学 66.8 61.0
GaoKao2023en 60.5 56.1
OlympiadBench 29.8 26.4
CollegeMath 43.5 39.8
AIME24 10.0 6.7

汎用能力ベンチマークでも7B-Instructモデルが有利で、MMLU(68.7対60.6)、IFEval(58.6対38.6)、GPQA(35.6対27.6)で高得点を示しています。

ライセンスと入手方法

Qwen2.5-CoderはApache 2.0ライセンスの下でリリースされ、コードインテリジェンスへの広範な応用を促進します。1.5Bと7Bモデルは現在入手可能で、32Bバージョンは近くプロプライエタリモデルに挑戦する形でリリース予定です。

Sources