Qwen3-VL-Embedding 与 Qwen3-VL-Reranker 发布
Qwen 宣布发布 Qwen3-VL-Embedding 与 Qwen3-VL-Reranker,这是一系列专为多模态信息检索和跨模态理解而设计的新模型。基于 Qwen3-VL 基础模型,这些工具能够在统一框架中无缝处理文本、图像、截图和视频,从而提升多模态内容检索的准确性。
技术架构
Qwen3-VL-Embedding 与 Qwen3-VL-Reranker 采用不同的架构方式,以在检索流水线中平衡效率和精度。
Qwen3-VL-Embedding(双塔)
Embedding 模型采用双塔架构,将单模态或混合模态输入映射为高维语义向量。它从基础模型的最后一层提取 [EOS] 标记的隐藏状态向量,作为最终的语义表示。此独立编码方式能够在向量空间中高效、规模化地检索候选项。
Qwen3-VL-Reranker(单塔)
Reranker 使用单塔架构并结合交叉注意力机制,对(查询,文档)对进行联合编码。通过分析查询与文档之间的交互,模型基于生成特殊标记(yes 和 no)的概率输出精确的相关性得分。
模型规格
Embedding 与 Reranker 系列均提供 2B 和 8B 参数规模。所有模型支持 32K 的序列长度,并具备指令感知能力,可针对任务自定义输入指令。
| 模型 | 参数规模 | 层数 | 序列长度 | 嵌入维度 | 量化 | MRL 支持 |
|---|---|---|---|---|---|---|
| Qwen3-VL-Embedding-2B | 2B | 28 | 32K | 2048 | Yes | Yes |
| Qwen3-VL-Embedding-8B | 8B | 36 | 32K | 4096 | Yes | Yes |
| Qwen3-VL-Reranker-2B | 2B | 28 | 32K | - | - | - |
| Qwen3-VL-Reranker-8B | 8B | 36 | 32K | - | - | - |
性能与基准测试
Qwen3-VL-Embedding-8B 在 MMEB-v2 基准上取得了业界领先(SOTA)成绩,超越了此前的开源和专有模型。它在图像、视觉文档和视频检索子任务中始终保持领先。
在仅文本的多语言 MMTEB 基准上,Qwen3-VL-Embedding 模型与其他同规模模型竞争激烈,尽管相较于仅文本的 Qwen3-Embedding 模型仍存在性能差距。
Reranker 评估
Qwen3-VL-Reranker 模型在各类数据集(包括 JinaVDR 和 ViDoRe v3)上始终优于基础 Embedding 模型和基线 Reranker。8B 变体在大多数任务中提供了最高的性能。
| 模型 | MMEB-v2(平均) | MMEB-v2(图像) | MMEB-v2(视频) | MMEB-v2(视觉文档) | MMTEB | JinaVDR | ViDoRe(v3) |
|---|---|---|---|---|---|---|---|
| Qwen3-VL-Embedding-2B | 73.4 | 74.8 | 53.6 | 79.2 | 68.1 | 71.0 | 52.9 |
| jina-reranker-m0 | - | 68.2 | - | 85.2 | - | 82.2 | 57.8 |
| Qwen3-VL-Reranker-2B | 75.1 | 73.8 | 52.1 | 83.4 | 70.0 | 80.9 | 60.8 |
| Qwen3-VL-Reranker-8B | 79.2 | 80.7 | 55.8 | 86.3 | 74.9 | 83.6 | 66.7 |
检索流水线中的实现
为获得最佳效果,Embedding 与 Reranker 模型在两阶段检索流程中使用:
- 初始召回:Qwen3-VL-Embedding 模型高效地从向量空间检索出大量候选项。
- 精细排序:Qwen3-VL-Reranker 模型通过联合编码对这些候选项进行排序,提供最精确的最终结果。
这种组合方式利用 Embedding 模型的高效可扩展性和 Reranker 的精确细粒度对齐。