Qwen2.5-Turbo 1Mトークン コンテキスト長 リリース

Qwenは、モデルのコンテキストウィンドウを128kから100万トークンに拡張したQwen2.5-Turboをリリースしました。このアップデートにより、約10冊のフルレングス小説または30,000行のコードに相当する巨大なデータセットの処理が可能になり、推論速度とコスト効率が大幅に向上します。

拡張されたコンテキスト機能

Qwen2.5-Turboは、最大100万トークンのコンテキスト長をサポートし、これは約100万語の英語または150万字の中国語に相当します。この拡張により、全三部作の書籍の要約やリポジトリレベルのコード分析など、複雑で大規模なデータ処理タスクが可能になります。

長コンテキストパフォーマンスベンチマーク

このモデルは、超長シーケンスから情報を取得する際に高い精度を示します:

  • Passkey Retrieval: 1Mトークン長のPasskey Retrievalタスクで100%の精度を達成します。
  • RULER ベンチマーク: 93.1点を獲得し、GPT-4 (91.6)およびGLM4-9B-1M (89.9)を上回ります。
  • Complex Understanding: LV-EvalやLongbenchChatなどのベンチマークにおいて、128kトークンを超えるコンテキストを処理する際、Qwen2.5-Turboはほとんどの次元でGPT-4o-miniを上回ります。

短シーケンスの安定性

コンテキストの拡張において一般的な問題は、短いシーケンスでの性能低下です。Qwen2.5-Turboは、GPT-4o-miniと同等の短シーケンス機能を維持するように設計されており、コンテキストウィンドウを増やしても標準的な会話や推論の性能が損なわれないことを保証します。

推論の最適化とコスト効率

Qwen2.5-Turboは、スパースアテンションメカニズムを通じて長コンテキスト処理の計算要求に対応するため、重要な最適化を導入します。

速度と効率

  • Reduced Latency: スパースアテンションメカニズムの使用により、1MトークンコンテキストのTime to First Token (TTFT)が4.9分から68秒に短縮され、4.3倍の速度向上を実現します。
  • Computational Compression: スパースアテンションにより、アテンション計算が約12.5倍圧縮されます。

価格と価値

  • Cost-Effective Scaling: モデルの価格は100万トークンあたり¥0.3です。この価格帯では、Qwen2.5-TurboはGPT-4o-miniの3.6倍のトークンを処理できます。

実装と利用可能性

Qwen2.5-Turboは、Alibaba Cloud Model Studio APIを通じて利用可能です。このAPIはOpenAI SDKと互換性があり、qwen-turbo-latestモデル識別子を使用して既存のPythonワークフローに簡単に統合できます。

開発者は次の方法でモデルにアクセスできます:

  • Alibaba Cloud Model Studio (API)
  • HuggingFace Demo
  • **ModelScope Demo"}

Sources