Qwen3-VL-Embedding 與 Qwen3-VL-Reranker 發布
Qwen 宣布發布 Qwen3-VL-Embedding 和 Qwen3-VL-Reranker,這是一系列專為多模態資訊檢索與跨模態理解而設計的新模型。基於 Qwen3-VL 基礎模型,這些工具能在統一框架中無縫處理文字、圖像、螢幕截圖與影片,以提升多模態內容檢索的準確性。
技術架構
Qwen3-VL-Embedding 與 Qwen3-VL-Reranker 採用不同的架構方法,以在檢索流程中平衡效率與精確度。
Qwen3-VL-Embedding(雙塔)
Embedding 模型使用雙塔架構,將單模態或混合模態輸入映射為高維語意向量。它從基礎模型最後一層提取 [EOS] token 的隱藏狀態向量,作為最終語意表示。此獨立編碼允許在向量空間中高效、大規模地檢索候選項目。
Qwen3-VL-Reranker(單塔)
Reranker 採用單塔架構,結合 Cross-Attention 機制,以對 (Query, Document) 配對進行聯合編碼。透過分析查詢與文件之間的互動,模型根據產生特殊 token(yes 和 no)的機率輸出精確的相關性分數。
模型規格
Embedding 與 Reranker 系列皆提供 2B 與 8B 參數規模。所有模型支援 32K 序列長度,且具備指令感知能力,允許針對任務自訂輸入指令。
| 模型 | 規模 | 層數 | 序列長度 | 嵌入維度 | 量化 | MRL 支援 |
|---|---|---|---|---|---|---|
| Qwen3-VL-Embedding-2B | 2B | 28 | 32K | 2048 | Yes | Yes |
| Qwen3-VL-Embedding-8B | 8B | 36 | 32K | 4096 | Yes | Yes |
| Qwen3-VL-Reranker-2B | 2B | 28 | 32K | - | - | - |
| Qwen3-VL-Reranker-8B | 8B | 36 | 32K | - | - | - |
效能與基準測試
Qwen3-VL-Embedding-8B 在 MMEB-v2 基準測試上達到最先進(SOTA)表現,超越先前的開源與專有模型。它在影像、視覺文件與影片檢索子任務上持續位居榜首。
在僅文字的多語言 MMTEB 基準測試中,Qwen3-VL-Embedding 模型與其他相同規模的模型競爭激烈,儘管相較於僅文字的 Qwen3-Embedding 模型仍有表現差距。
Reranker 評估
Qwen3-VL-Reranker 模型在各種資料集(包括 JinaVDR 與 ViDoRe v3)上持續優於基礎 Embedding 模型與基線 Reranker。8B 變體在大多數任務中提供最高的效能。
| 模型 | MMEB-v2(平均) | MMEB-v2(影像) | MMEB-v2(影片) | MMEB-v2(視覺文件) | MMTEB | JinaVDR | ViDoRe(v3) |
|---|---|---|---|---|---|---|---|
| Qwen3-VL-Embedding-2B | 73.4 | 74.8 | 53.6 | 79.2 | 68.1 | 71.0 | 52.9 |
| jina-reranker-m0 | - | 68.2 | - | 85.2 | - | 82.2 | 57.8 |
| Qwen3-VL-Reranker-2B | 75.1 | 73.8 | 52.1 | 83.4 | 70.0 | 80.9 | 60.8 |
| Qwen3-VL-Reranker-8B | 79.2 | 80.7 | 55.8 | 86.3 | 74.9 | 83.6 | 66.7 |
在檢索流程中的實作
為獲得最佳結果,Embedding 與 Reranker 模型在兩階段檢索流程中使用:
- 初始召回:Qwen3-VL-Embedding 模型高效地從向量空間檢索出廣泛的候選項目。
- 精細排序:Qwen3-VL-Reranker 模型使用聯合編碼對這些候選項目進行排序,以提供最精確的最終結果。
此結合方法利用 Embedding 模型的效率以提升可擴展性,並利用 Reranker 的精確度進行細緻對齊。