Qwen3-VL-Embedding と Qwen3-VL-Reranker のリリース
Qwen は、マルチモーダル情報検索とクロスモーダル理解のために特別に設計された新しいモデルシリーズである Qwen3-VL-Embedding と Qwen3-VL-Reranker のリリースを発表しました。Qwen3-VL 基盤モデル上に構築されたこれらのツールは、テキスト、画像、スクリーンショット、動画を統一されたフレームワークでシームレスに扱うことができ、マルチモーダルコンテンツ検索の精度向上を実現します。
技術アーキテクチャ
Qwen3-VL-Embedding と Qwen3-VL-Reranker は、検索パイプラインにおいて効率性と精度のバランスを取るために異なるアーキテクチャ手法を採用しています。
Qwen3-VL-Embedding(デュアルタワー)
Embedding モデルはデュアルタワーアーキテクチャを使用し、単一モーダルまたは混合モーダルの入力を高次元のセマンティックベクトルにマッピングします。ベースモデルの最終層から [EOS] トークンの隠れ状態ベクトルを抽出し、最終的なセマンティック表現として使用します。この独立したエンコーディングにより、ベクトル空間から候補を効率的かつ大規模に検索することが可能になります。
Qwen3-VL-Reranker(シングルタワー)
Reranker はクロスアテンション機構を備えたシングルタワーアーキテクチャを使用し、(クエリ、ドキュメント)ペアの共同エンコーディングを実行します。クエリとドキュメント間の相互作用を分析することで、特別なトークン(yes と no)が生成される確率に基づく正確な関連スコアを出力します。
モデル仕様
Embedding と Reranker の両シリーズは、2B と 8B のパラメータサイズで提供されます。すべてのモデルは 32K のシーケンス長をサポートし、インストラクションに対応しているため、タスク固有の入力指示をカスタマイズできます。
| モデル | サイズ | 層数 | シーケンス長 | 埋め込み次元 | 量子化 | MRLサポート |
|---|---|---|---|---|---|---|
| Qwen3-VL-Embedding-2B | 2B | 28 | 32K | 2048 | はい | はい |
| Qwen3-VL-Embedding-8B | 8B | 36 | 32K | 4096 | はい | はい |
| Qwen3-VL-Reranker-2B | 2B | 28 | 32K | - | - | - |
| Qwen3-VL-Reranker-8B | 8B | 36 | 32K | - | - | - |
パフォーマンスとベンチマーク
Qwen3-VL-Embedding-8B は MMEB-v2 ベンチマークで最先端(SOTA)の結果を達成し、従来のオープンソースおよび商用モデルを上回っています。画像、ビジュアルドキュメント、動画検索のサブタスクすべてで一貫してトップの性能を示します。
テキストのみの多言語 MMTEB ベンチマークにおいて、Qwen3-VL-Embedding モデルは同規模の他モデルと非常に競争力がありますが、テキスト専用の Qwen3-Embedding モデルに比べて性能差が見られます。
Reranker の評価
Qwen3-VL-Reranker モデルは、JinaVDR や ViDoRe v3 などのさまざまなデータセットにおいて、ベースの Embedding モデルやベースラインの Reranker を一貫して上回ります。8B バリアントはほとんどのタスクで最高の性能を提供します。
| モデル | MMEB-v2(平均) | MMEB-v2(画像) | MMEB-v2(動画) | MMEB-v2(VisDoc) | MMTEB | JinaVDR | ViDoRe(v3) |
|---|---|---|---|---|---|---|---|
| Qwen3-VL-Embedding-2B | 73.4 | 74.8 | 53.6 | 79.2 | 68.1 | 71.0 | 52.9 |
| jina-reranker-m0 | - | 68.2 | - | 85.2 | - | 82.2 | 57.8 |
| Qwen3-VL-Reranker-2B | 75.1 | 73.8 | 52.1 | 83.4 | 70.0 | 80.9 | 60.8 |
| Qwen3-VL-Reranker-8B | 79.2 | 80.7 | 55.8 | 86.3 | 74.9 | 83.6 | 66.7 |
検索パイプラインへの実装
最適な結果を得るために、Embedding と Reranker モデルは二段階の検索プロセスで使用されます:
- Initial Recall: Qwen3-VL-Embedding モデルはベクトル空間から広範な候補を効率的に検索します。
- Refined Ranking: Qwen3-VL-Reranker モデルは共同エンコーディングを用いてこれらの候補を並べ替え、最も正確な最終結果を提供します。
この組み合わせアプローチは、スケーラビリティのための Embedding モデルの効率性と、細かな整合性のための Reranker の精度を活かしています。