Qwen3-VL-Embedding 與 Qwen3-VL-Reranker 發布

Qwen 宣布發布 Qwen3-VL-Embedding 和 Qwen3-VL-Reranker,這是一系列專為多模態資訊檢索與跨模態理解而設計的新模型。基於 Qwen3-VL 基礎模型,這些工具能在統一框架中無縫處理文字、圖像、螢幕截圖與影片,以提升多模態內容檢索的準確性。

技術架構

Qwen3-VL-Embedding 與 Qwen3-VL-Reranker 採用不同的架構方法,以在檢索流程中平衡效率與精確度。

Qwen3-VL-Embedding(雙塔)

Embedding 模型使用雙塔架構,將單模態或混合模態輸入映射為高維語意向量。它從基礎模型最後一層提取 [EOS] token 的隱藏狀態向量,作為最終語意表示。此獨立編碼允許在向量空間中高效、大規模地檢索候選項目。

Qwen3-VL-Reranker(單塔)

Reranker 採用單塔架構,結合 Cross-Attention 機制,以對 (Query, Document) 配對進行聯合編碼。透過分析查詢與文件之間的互動,模型根據產生特殊 token(yesno)的機率輸出精確的相關性分數。

模型規格

Embedding 與 Reranker 系列皆提供 2B 與 8B 參數規模。所有模型支援 32K 序列長度,且具備指令感知能力,允許針對任務自訂輸入指令。

模型 規模 層數 序列長度 嵌入維度 量化 MRL 支援
Qwen3-VL-Embedding-2B 2B 28 32K 2048 Yes Yes
Qwen3-VL-Embedding-8B 8B 36 32K 4096 Yes Yes
Qwen3-VL-Reranker-2B 2B 28 32K - - -
Qwen3-VL-Reranker-8B 8B 36 32K - - -

效能與基準測試

Qwen3-VL-Embedding-8B 在 MMEB-v2 基準測試上達到最先進(SOTA)表現,超越先前的開源與專有模型。它在影像、視覺文件與影片檢索子任務上持續位居榜首。

在僅文字的多語言 MMTEB 基準測試中,Qwen3-VL-Embedding 模型與其他相同規模的模型競爭激烈,儘管相較於僅文字的 Qwen3-Embedding 模型仍有表現差距。

Reranker 評估

Qwen3-VL-Reranker 模型在各種資料集(包括 JinaVDR 與 ViDoRe v3)上持續優於基礎 Embedding 模型與基線 Reranker。8B 變體在大多數任務中提供最高的效能。

模型 MMEB-v2(平均) MMEB-v2(影像) MMEB-v2(影片) MMEB-v2(視覺文件) MMTEB JinaVDR ViDoRe(v3)
Qwen3-VL-Embedding-2B 73.4 74.8 53.6 79.2 68.1 71.0 52.9
jina-reranker-m0 - 68.2 - 85.2 - 82.2 57.8
Qwen3-VL-Reranker-2B 75.1 73.8 52.1 83.4 70.0 80.9 60.8
Qwen3-VL-Reranker-8B 79.2 80.7 55.8 86.3 74.9 83.6 66.7

在檢索流程中的實作

為獲得最佳結果,Embedding 與 Reranker 模型在兩階段檢索流程中使用:

  1. 初始召回:Qwen3-VL-Embedding 模型高效地從向量空間檢索出廣泛的候選項目。
  2. 精細排序:Qwen3-VL-Reranker 模型使用聯合編碼對這些候選項目進行排序,以提供最精確的最終結果。

此結合方法利用 Embedding 模型的效率以提升可擴展性,並利用 Reranker 的精確度進行細緻對齊。

Sources