Qwen3-VL-Embedding 및 Qwen3-VL-Reranker 출시

Qwen은 멀티모달 정보 검색 및 교차 모달 이해를 위해 특별히 설계된 새로운 모델 시리즈인 Qwen3-VL-Embedding 및 Qwen3-VL-Reranker의 출시를 발표했습니다. Qwen3-VL 기반 모델 위에 구축된 이 도구들은 텍스트, 이미지, 스크린샷 및 비디오를 통합 프레임워크 내에서 원활하게 처리하여 멀티모달 콘텐츠 검색의 정확성을 향상시킵니다.

기술 아키텍처

Qwen3-VL-Embedding 및 Qwen3-VL-Reranker는 검색 파이프라인에서 효율성과 정밀성의 균형을 맞추기 위해 서로 다른 아키텍처 접근 방식을 사용합니다.

Qwen3-VL-Embedding (듀얼 타워)

Embedding 모델은 단일 모달 또는 혼합 모달 입력을 고차원 의미 벡터로 매핑하기 위해 듀얼 타워 아키텍처를 사용합니다. 기본 모델의 마지막 레이어에서 [EOS] 토큰의 은닉 상태 벡터를 추출하여 최종 의미 표현으로 활용합니다. 이러한 독립적인 인코딩은 벡터 공간에서 후보를 효율적이고 대규모로 검색할 수 있게 합니다.

Qwen3-VL-Reranker (싱글 타워)

Reranker는 교차 주의(Cross-Attention) 메커니즘을 갖춘 싱글 타워 아키텍처를 사용하여 (쿼리, 문서) 쌍을 공동 인코딩합니다. 쿼리와 문서 간의 상호 작용을 분석함으로써 모델은 특수 토큰(yesno) 생성 확률을 기반으로 정확한 관련성 점수를 출력합니다.

모델 사양

Embedding 및 Reranker 시리즈 모두 2B와 8B 파라미터 크기로 제공됩니다. 모든 모델은 32K 시퀀스 길이를 지원하며, 인스트럭션 인식 기능을 갖추어 입력 인스트럭션을 작업에 맞게 맞춤 설정할 수 있습니다.

모델 크기 레이어 시퀀스 길이 임베딩 차원 양자화 MRL 지원
Qwen3-VL-Embedding-2B 2B 28 32K 2048
Qwen3-VL-Embedding-8B 8B 36 32K 4096
Qwen3-VL-Reranker-2B 2B 28 32K - - -
Qwen3-VL-Reranker-8B 8B 36 32K - - -

성능 및 벤치마크

Qwen3-VL-Embedding-8B는 MMEB-v2 벤치마크에서 최첨단(SOTA) 결과를 달성하여 기존 오픈소스 및 상용 모델을 능가합니다. 이미지, 시각 문서, 비디오 검색 하위 작업 전반에서 지속적으로 최고 성능을 보입니다.

텍스트 전용 다국어 MMTEB 벤치마크에서는 Qwen3-VL-Embedding 모델이 동일 규모의 다른 모델들과 매우 경쟁력이 있지만, 텍스트 전용 Qwen3-Embedding 모델에 비해 성능 격차가 존재합니다.

Reranker 평가

Qwen3-VL-Reranker 모델은 JinaVDR 및 ViDoRe v3를 포함한 다양한 데이터셋에서 기본 Embedding 모델 및 기존 Reranker를 지속적으로 능가합니다. 8B 변형은 대부분의 작업에서 가장 높은 성능을 제공합니다.

모델 MMEB-v2 (평균) MMEB-v2 (이미지) MMEB-v2 (비디오) MMEB-v2 (시각문서) MMTEB JinaVDR ViDoRe (v3)
Qwen3-VL-Embedding-2B 73.4 74.8 53.6 79.2 68.1 71.0 52.9
jina-reranker-m0 - 68.2 - 85.2 - 82.2 57.8
Qwen3-VL-Reranker-2B 75.1 73.8 52.1 83.4 70.0 80.9 60.8
Qwen3-VL-Reranker-8B 79.2 80.7 55.8 86.3 74.9 83.6 66.7

검색 파이프라인에서의 구현

최적의 결과를 위해 Embedding 및 Reranker 모델은 두 단계 검색 프로세스에서 사용됩니다:

  1. 초기 리콜: Qwen3-VL-Embedding 모델은 벡터 공간에서 광범위한 후보 집합을 효율적으로 검색합니다.
  2. 정제된 랭킹: Qwen3-VL-Reranker 모델은 공동 인코딩을 사용해 이러한 후보들을 정렬하여 가장 정확한 최종 결과를 제공합니다.

이 결합된 접근 방식은 확장성을 위한 Embedding 모델의 효율성과 세밀한 정렬을 위한 Reranker의 정밀성을 활용합니다.

Sources