Qwen3-VL-Embedding 与 Qwen3-VL-Reranker 发布

Qwen 宣布发布 Qwen3-VL-Embedding 与 Qwen3-VL-Reranker,这是一系列专为多模态信息检索和跨模态理解而设计的新模型。基于 Qwen3-VL 基础模型,这些工具能够在统一框架中无缝处理文本、图像、截图和视频,从而提升多模态内容检索的准确性。

技术架构

Qwen3-VL-Embedding 与 Qwen3-VL-Reranker 采用不同的架构方式,以在检索流水线中平衡效率和精度。

Qwen3-VL-Embedding(双塔)

Embedding 模型采用双塔架构,将单模态或混合模态输入映射为高维语义向量。它从基础模型的最后一层提取 [EOS] 标记的隐藏状态向量,作为最终的语义表示。此独立编码方式能够在向量空间中高效、规模化地检索候选项。

Qwen3-VL-Reranker(单塔)

Reranker 使用单塔架构并结合交叉注意力机制,对(查询,文档)对进行联合编码。通过分析查询与文档之间的交互,模型基于生成特殊标记(yesno)的概率输出精确的相关性得分。

模型规格

Embedding 与 Reranker 系列均提供 2B 和 8B 参数规模。所有模型支持 32K 的序列长度,并具备指令感知能力,可针对任务自定义输入指令。

模型 参数规模 层数 序列长度 嵌入维度 量化 MRL 支持
Qwen3-VL-Embedding-2B 2B 28 32K 2048 Yes Yes
Qwen3-VL-Embedding-8B 8B 36 32K 4096 Yes Yes
Qwen3-VL-Reranker-2B 2B 28 32K - - -
Qwen3-VL-Reranker-8B 8B 36 32K - - -

性能与基准测试

Qwen3-VL-Embedding-8B 在 MMEB-v2 基准上取得了业界领先(SOTA)成绩,超越了此前的开源和专有模型。它在图像、视觉文档和视频检索子任务中始终保持领先。

在仅文本的多语言 MMTEB 基准上,Qwen3-VL-Embedding 模型与其他同规模模型竞争激烈,尽管相较于仅文本的 Qwen3-Embedding 模型仍存在性能差距。

Reranker 评估

Qwen3-VL-Reranker 模型在各类数据集(包括 JinaVDR 和 ViDoRe v3)上始终优于基础 Embedding 模型和基线 Reranker。8B 变体在大多数任务中提供了最高的性能。

模型 MMEB-v2(平均) MMEB-v2(图像) MMEB-v2(视频) MMEB-v2(视觉文档) MMTEB JinaVDR ViDoRe(v3)
Qwen3-VL-Embedding-2B 73.4 74.8 53.6 79.2 68.1 71.0 52.9
jina-reranker-m0 - 68.2 - 85.2 - 82.2 57.8
Qwen3-VL-Reranker-2B 75.1 73.8 52.1 83.4 70.0 80.9 60.8
Qwen3-VL-Reranker-8B 79.2 80.7 55.8 86.3 74.9 83.6 66.7

检索流水线中的实现

为获得最佳效果,Embedding 与 Reranker 模型在两阶段检索流程中使用:

  1. 初始召回:Qwen3-VL-Embedding 模型高效地从向量空间检索出大量候选项。
  2. 精细排序:Qwen3-VL-Reranker 模型通过联合编码对这些候选项进行排序,提供最精确的最终结果。

这种组合方式利用 Embedding 模型的高效可扩展性和 Reranker 的精确细粒度对齐。

Sources