Qwen-VL-Plus と Qwen-VL-Max のリリース

Qwen は Qwen-VL シリーズの 2 つの強化バージョンである Qwen-VL-Plus と Qwen-VL-Max を導入しました。これらのモデルは、画像に関する推論、詳細な認識、そして 100 万ピクセルを超える高解像度画像や任意のアスペクト比の画像を処理する能力を大幅に向上させます。

モデル比較: Qwen-VL-Plus と Qwen-VL-Max

Qwen は、パフォーマンスと機能のバランスを取るために、強化された視覚言語モデルの 2 つの異なるバージョンを提供しています。

  • Qwen-VL-Plus: 詳細認識とテキスト認識能力を備えた強化された大規模視覚言語モデルで、超高解像度ピクセルと任意のアスペクト比をサポートします。
  • Qwen-VL-Max: シリーズで最も高性能なモデルで、視覚的推論と指示遵守能力をさらに向上させ、高度な認知理解と複雑なタスクに対応します。

パフォーマンスベンチマーク

Qwen-VL-Plus と Qwen-VL-Max は、複数のテキスト画像マルチモーダルタスクにおいて Gemini Ultra および GPT-4V と同等の性能を示します。特に、Qwen-VL-Max は中国語の質問応答と中国語テキスト理解において GPT-4V と Gemini の両方を上回ります。

Model DocVQA ChartQA AI2D TextVQA MMMU MathVista MM-Bench-CN
Other Best Open-source LVLM 81.6% 68.4% 73.7% 76.1% 45.9% 36.7% 72.4%
Gemini Pro 88.1% 74.1% 73.9% 74.6% 47.9% 45.2% 74.3%
Gemini Ultra 90.9% 80.8% 79.5% 82.3% 59.4% 53.0% -
GPT-4V 88.4% 78.5% 78.2% 78.0% 56.8% 49.9% 73.9%
Qwen-VL-Plus 91.4% 78.1% 75.9% 78.9% 45.2% 43.3% 68.0%
Qwen-VL-Max 93.1% 79.8% 79.3% 79.5% 51.4% 50.0% 75.1%

主な技術的能力

高解像度画像処理

Qwen-VL-Plus と Qwen-VL-Max は、100 万ピクセルを超える解像度とさまざまなアスペクト比の画像をサポートし、画像やテキスト内の詳細をより正確に認識できるようにします。

視覚的推論と問題解決

単純な記述を超えて、これらのモデルはフローチャート、図、記号体系などの複雑な表現を解釈できます。これには数学的問題解決やチャート・グラフの分析が含まれます。

ビジュアルエージェントとローカリゼーション

モデルは画像内の特定要素を特定し問い合わせる能力を持ち、例えば特定のオブジェクト(例: 赤い車)をハイライトし、シーンの同じコンテキストに基づいて判断を下すことができます。

テキスト情報認識

Qwen-VL-Plus/Max は中国語と英語のテキスト認識が大幅に向上しています。文書や表から情報を効率的に抽出し、JSON などのカスタム出力形式に再フォーマットして、密なテキスト処理に活用できます。

利用可能性

Qwen-VL-Plus と Qwen-VL-Max は以下を通じて利用可能です:

  • Huggingface Spaces: Plus と Max の両バージョンのデモ。
  • QianWen Web Portal: Qwen-VL-Max の画像理解モード。
  • Dashscope APIs: 両モデルへの API アクセス。

Sources